废弃的作业、实例和卷可能无限期运行,迫使财务运营(FinOps)工具必须开发针对GPU时代AI工作负载的新型僵尸资源清理方法。
企业很少招聘名为“僵尸工作负载猎人”的职位,但此类需求确实存在。随着每一次技术迭代,被遗弃的库、应用程序、服务和存储卷的残余部分依然存在,并继续消耗资源。最终,实用性要求必须识别并减少这些资产。你保留运行的东西会花费你的成本——但要找到它们需要系统性的搜寻。
如今,云财务运营(Cloud FinOps)工程师、成本优化专家和库存管理人员正在执行这种“搜寻并摧毁”的工作。这一新兴群体利用可观测性平台、CloudOps 实践和 FinOps 自动化来追踪以各种名称存在的资源——孤儿资源、流浪资源,以及是的,僵尸资产。他们预测容量需求,并自动停用闲置基础设施,理想情况下防止这些未使用的资源出现在云发票上。
对效率的追求从未像现在这样关键。新一波人工智能浪潮将数据中心行业推向了全国聚光灯下,而基于 GPU 加速的生成式和代理式 AI 模型加剧了公众对资源消耗的审视。同时,企业团队重新强调了对计算成本的重视。
僵尸工作负载在多云和本地环境中默默地消耗电力、机架空间和预算。IDCA 首席研究官 Roger Strukhoff 指出,它们通常遵循可预测的模式。Strukhoff 在接受 Data Center Knowledge 采访时提到,云僵尸经常源于“停止使用应用程序但从未删除它们的个人或部门”。他补充道:“当内部组织合并或公司被收购时,如果没有人负责清理未使用的云实例和应用程序,它们就会出现。”
IDCA 的研究表明,高达 13% 的美国云使用量源于这些休眠的工作负载。FinOps 工具供应商如 Broadcom(VMware Aria Cost,前身为 CloudHealth)和 AWS(Cost Explorer, Compute Optimizer)——通常受雇帮助纠正浪费——估计整体云低效程度甚至更高,通常在 25% 到 30% 之间,其中孤儿存储卷和被遗忘的计算实例贡献显著。这个问题根深蒂固,不断演变的应用程序架构使情况变得更加复杂。
目前管理云混乱的策略大多可以追溯到 Unix 的 kill 命令。在无服务器架构中,缩容至零的配置强制执行运行时边界,确保空闲服务停止资源消耗并停止产生费用。然而,这些方法存在权衡。错误识别活动服务可能会触发冷启动,并在实例初始化期间引入不希望的延迟——这对于经历流量尖峰的应用程序来说是一个重大缺点。
一套不断扩展的云原生和平台增强功能正在填补这一空白。包括 Google、Flexera、Datadog 和 IBM 在内的供应商提供解决方案,将账单和性能数据关联起来,以标记针对未使用资源的活跃费用。这些平台持续索引资产以识别不活动和断裂的父子依赖关系,同时通过自动策略执行系统地拆除那些否则会在数据中心环境中隐蔽存在的进程。
无限期执行的程序远早于云计算的出现,起源于大型机,并历经客户端/服务器和虚拟化时代幸存下来。Intellyx 分析师、中间件和分布式计算老兵 Eric Newcomer 观察到,传统的操作方式只是“拔掉插头,等待有人尖叫”。
随着云原生微服务的兴起,这种范式发生了转变。Newcomer 解释说:“云计算引入了在后台运行以向其他服务提供数据的无头服务。”“许多基于微服务的应用程序由数百个独立组件组成。如果主应用程序失败,僵尸服务可能会继续运行——并且毫无作为。”
云计算最初依赖于商用硬件、大规模扩张、激进复制和 Kubernetes 等容器编排平台。然而,这些创新并不能无缝转化为现代大语言模型(LLM)和代理式 AI。为当代 AI 提供动力的以 GPU 为中心的基础设施与为传统分布式计算设计的商用架构从根本上不同——而 AI 相关的僵尸带来了高得多的财务和能源成本。
Newcomer 指出,在 Linux Foundation 和 Cloud Native Computing Foundation 的指导下,Kubernetes 正在适应以更好地容纳 AI 工作负载,从而产生不同类型的休眠进程。虽然这些 Kubernetes 进步正在新兴的专注于 AI 的云提供商中推出,但大多数开发仍处于起步阶段。
在 Kubernetes 上部署 AI 进一步受到生成式和代理式 AI 快速演变的景观的复杂化影响。大量的研发仍在继续,工程团队 routinely 管理延长的作业生命周期、流水线中的故障以及未能终止已完成任务的编排脚本。加剧这些挑战的是处理模型权重、数据摄取管道和相关基础设施的固有复杂性。
AI 优化平台 Akamas 的开发关系工程师兼 CNCF 大使 Graziano Castro 表示,这种动态产生了根本不同的工作负载配置文件。Castro 在与 Data Center Knowledge 的通信中强调了财务影响:“GPU 比 CPU 核心更昂贵,因此之前在云账单上只是四舍五入误差的低效变成了非常真实的数字。闲置的 GPU 不是小浪费。”他继续说道:“LLM 时代改变的是,忽视低效的成本几乎在一夜之间上升了一个数量级。”
虽然此类低效在研发期间是可以容忍的,但它们在生产中成为关键的瓶颈,催生了一个昂贵的新型僵尸类别:闲置或被弃用的 GPU。
Castro 指出:“Kubernetes 正在迅速扩展到这一领域,生态系统明显正在开发新的原语以保持同步。”“然而,这一过渡暴露了平台的基础假设是为更便宜、高度弹性的工作负载优化的每一个领域,而不是今天对其施加的密集需求。”
为了弥补这些差距,Kubernetes 正朝着特定于 AI 的功能迈进,包括为专用加速器进行动态资源分配,以及考虑许多 AI 训练和推理作业固有的拓扑和位置约束的智能批处理调度。因此,效率监控和僵尸补救现在严重依赖于严格的 GPU 健康和利用率跟踪。细粒度的芯片级可观测性对于维持运营稳定性至关重要。
Castro 强调了 NVIDIA 的数据中心 GPU 管理器(DCGM)作为评估表观 GPU 利用率的关键监控基线。“关键在于‘表观’这个词,”他警告道。“GPU 可以在 DCGM 指标上注册高利用率,但实际上保持空闲,仅仅是在等待传入数据或集群中的另一个 GPU 完成同一作业的份额。”
网络吞吐量在这些监控框架中往往仍然是盲点。Castro 强调了持续进行的 OpenTelemetry 标准化工作的重要性,指出不同的工具必须互操作才能准确关联性能信号。这些举措正在为监控复杂的 AI 工作负载建立共享术语和方法论。
尽管出现了新型僵尸类别,Strukhoff 强调基础治理仍然至关重要。组织必须建立明确的政策以系统地退役休眠工作负载。“必须提醒个人用户在任务完成后终止他们的实例,”他建议道。“理想情况下,组织应该部署监控系统,向管理员发出僵尸工作负载警报,并自动执行策略以关闭未使用的资源。”
在操作上,这转化为定期的全环境使用审计和标准化的退役程序——特别是在内部重组或公司收购之后。虽然监控工具继续成熟,工作负载架构也在演变,但基本原则保持不变:你保留运行的东西会花费你的成本。
Jack Vaughan 是一名自由记者,此前曾负责 TechTarget 旗下 SearchDataManagement、SearchOracle 和 SearchSQLServer 的编辑报道。在 2004 年加入 TechTarget 之前,他曾担任 Application Development Trends 和 ADTmag.com 的特约编辑。他在计算机硬件和软件方面的写作也见于 Software Magazine、Digital Design 和 EDN News Edition。他拥有波士顿大学的新闻学学士学位和科学传播硕士学位。