NVIDIA 与 AWS 合作打造托管企业 AI 基础设施,集成最新 GPU 技术与 AWS 服务(OpenSearch、EC2),支持大规模低延迟推理。
英伟达和亚马逊网络服务公司宣布了一项大规模基础设施合作,旨在帮助陷于令人印象深刻的原型和真正可扩展的生产就绪系统之间的企业。两家公司辩称,与其说是创新问题,不如说大多数企业面临的是AI部署问题。
该合作将英伟达的GPU架构直接集成到Amazon OpenSearch和Amazon EC2中,解决了两家公司认定的AI生产的四大关键挑战:延迟瓶颈、缓慢的向量搜索、GPU经济性不佳,以及随着系统增长而崩溃的基础设施复杂性。这种技术集成比典型的合作更深入——英伟达的加速技术直接嵌入AWS的搜索和计算基础设施中,使已投资于AWS的企业能够利用加速推理和向量搜索,而无需重建整个技术栈。
向量搜索在合作中受到特别强调,原因充分。随着公司构建检索增强生成系统和语义搜索工具,向量数据库性能变得至关重要。缓慢的向量搜索直接导致缓慢的AI响应,从而导致用户流失。英伟达的加速技术承诺在OpenSearch环境中提供显著的性能改进。
GPU的价格性能经济学至关重要。虽然模型训练占据头条,但推理——在生产中实际运行AI模型——是成本悄悄爆炸的地方。公司发现其聊天机器人在规模上每次查询成本为0.50美元后,经常面临预算取消。EC2实例上更好的GPU经济性可能决定AI项目是否获得批准,或在启动前夭折。
企业AI系统经常遇到一个更微妙的制约:在100个用户下表现完美的解决方案往往在10,000个用户时崩溃,不是因为模型失败,而是因为基础设施无法扩展而不变得难以管理。英伟达-AWS合作特别针对操作复杂性,表明两家公司已经内化了相同的企业客户痛点。
该合作超越了典型的共同营销。对于AWS来说,更深入的英伟达集成加强了其对Microsoft Azure和Google Cloud的竞争地位,两者都在AI基础设施上积极推进。对于英伟达来说,将其技术嵌入世界最大的云平台确保了它仍然是企业AI工作负载的默认选择,尽管来自AMD和定制硅芯片的竞争加剧。
时机反映了企业AI支出的更广泛转变:公司正在从实验转向部署,使真正能在规模上工作的基础设施突然比花哨的概念验证更有价值。该合作似乎是为了捕捉这个转折时刻。
仍然不确定的是,这一基础设施进步是否会转化为更快的企业AI采用,或者仅仅是使昂贵的项目成本略低。技术约束是真实的,组织、监管和数据质量挑战也是真实的,而GPU加速无法解决这些问题。真正的考验来自企业尝试将AI项目从试点转向生产规模时——以及这一基础设施合作是否真正履行了其减少这一过程中摩擦的承诺。