NVIDIA推出新硬件、软件工具和性能优化,使本地AI推理更快更易用
NVIDIA、Microsoft及合作伙伴正在合作加速本地AI推理,并简化在消费级和专业级NVIDIA硬件上的代理部署。这些公告包括来自Lenovo和Acer的新型紧凑型RTX Spark Windows PC,将于10月推出,游戏发行商包括Electronic Arts、Embark和Ubisoft将为该平台带来游戏。
三个广泛使用的代理应用程序正在接收Windows上的简化本地模型设置。Perplexity Portable Computer上月在Linux上为配备至少24GB VRAM的DGX Spark系统推出,即将推出Windows版本。该应用程序让用户能够在本地运行完整工作流,无需消耗云额度,还可以在需要时选择将部分任务升级到前沿模型。使用案例包括工程团队审查GitHub拉取请求和修复不同步的文档、金融专业人士在本地分析经纪报表和税务申报以识别费用和税收优化机会,以及初创公司分析漏斗数据以识别用户注册在安装和首次任务完成之间的流失位置。
由Nous Research开发并被数百万人使用的Hermes Agent在Windows上获得一键本地设置。该代理自动检测NVIDIA GPU,选择合适的模型和配置,并通过集成的llama.cpp运行,其中已配置NVIDIA优化。OpenClaw是GitHub上最大的AI项目,拥有超过380,000颗星,也为配备至少24GB VRAM的RTX GPU获得了简化的Windows设置。
性能改进包括llama.cpp通过内核优化和增强的推测解码在GeForce RTX 5090上提供高达1.9倍的吞吐量提升,vLLM在RTX PRO 6000上提供1.2倍改进,在DGX Spark集群上提供高达1.4倍改进。NVIDIA PAIR是一个免费的开源个人AI路由器,在本地网络上的PC之间分发推理请求,以在并行运行多个独立任务时优化性能。