2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

OpenAI正式发布了专为Stargate基础设施设计的首款自研AI芯片。

降低了超大规模企业对第三方加速器的依赖,并预示着将重塑GPU采购量的垂直整合趋势。
行业媒体Slicast · 2026年8月28日 · 美国 · 来源: Explainx Substack
重要度 80

周的人工智能领域,焦点集中在定制推理硬件、高效的多模态模型以及端侧智能上。从OpenAI开发自有推理芯片,到Z.ai推出成本优化模型,再到Liquid AI发布直接在消费级设备上对模型进行基准测试的新框架,人工智能正变得更快、更高效,并日益具备在更接近终端用户的地方运行的能力。

OpenAI发布了Jalapeño的初步性能数据,这是一款与Broadcom合作开发的定制AI推理芯片。该芯片专为大型语言模型服务负载而设计,在计算、内存移动、网络和推理服务方面进行了联合优化。早期基准测试表明,与基于NVIDIA Blackwell的系统相比,Jalapeño每瓦特算力高出1.5–1.9倍,延迟降低1.7–3.6倍。与许多迫使吞吐量与延迟之间做出权衡的架构不同,Jalapeño旨在同时提升这两项指标。据OpenAI称,该芯片已加速了ChatGPT的响应时间,并提高了Codex会话和代理的响应速度,凸显了软硬件协同设计的优势。Jalapeño还标志着多代AI计算平台的首次迭代,更广泛的部署计划于2026年下半年进行。

Z.ai推出了GLM-5.3-Flash,这是GLM-5系列中首个原生多模态模型,旨在以前沿级别的能力交付,同时最大限度地降低推理成本。该架构包含3200亿总参数,但仅激活180亿参数,利用混合设计融合了稀疏注意力和线性注意力机制。与GLM-5.3相比,这种方法将注意力计算减少了约3倍,并将KV缓存需求降低了约4.4倍,显著提高了长上下文和代理工作负载的效率。该模型支持100万token的上下文窗口,增加了针对文本、图像、截图和代码的原生视觉处理能力。它特别针对编码、视觉理解和长周期代理工作流进行了优化,具有竞争力的API定价使其成为高容量、对成本敏感应用的实用解决方案。该模型可通过Z.ai的编码生态系统访问,并被推广用于频繁且资源高效的AI部署。

Liquid AI推出了Pipette,这是一个开源基准测试平台,旨在回答一个关键的实践问题:哪种AI模型在你的特定设备上表现最佳?Pipette并非孤立地评估模型,而是评估整个部署堆栈,包括模型架构、量化方法、运行时、硬件、上下文长度、速度、延迟、内存消耗和输出质量。其首批公开数据集涵盖了超过1000种配置,涉及30多种模型、量化技术、运行时、设备和上下文长度,并提供适用于macOS、Windows、iOS和Android的基准测试客户端。该平台具有交互式排行榜和仪表板,使开发人员能够根据真实的设备端性能比较模型,而不是完全依赖云基准测试或参数量。随着较小模型和边缘AI能力的增强,这种细粒度的评估至关重要;在服务器环境中表现优异的模型,在手机或笔记本电脑上的表现可能会有显著差异。Pipette旨在使这些性能变化对于构建本地AI应用的开发人员来说可测量、可复现且可操作。

Claude AI Design使用户能够通过简单的提示、截图和网站元数据生成精美的产品演示视频,作为一种简化的设计AI,用于演示文稿和视觉叙事,无需高级编辑专业知识。X1是一款AI应用构建器,指导开发人员从概念逐步走向可发布的iPhone应用程序,避免了单提示生成的陷阱。Expertise AI提供了一个创建、部署、共享和货币化AI技能的平台。专家可以将受保护的操作手册作为独立技能发布,允许企业即时安装或自定义自己的技能,从而在整个组织中扩展机构知识。ChatCut Desktop引入了一款由AI驱动的视频编辑器,专为协作式人机工作流设计。用户可以通过自然语言指导编辑,或集成ChatGPT、Codex或Claude Code,并在完全可编辑的时间线上查看更改渲染效果。MCP-Builder.ai简化了托管安全MCP服务器的创建过程。类似于Lovable for MCP连接器,它根据用户描述自动构建、托管和保护连接器,消除了手动基础设施和安全配置的需要。Tellie Prompter 1.5重新设计了提词器功能,使其适应演讲者,而不是强制严格遵循文本。它监听实时语音,允许停顿、即兴发挥或偏离脚本,而1.5版则预测即将出现的内容以保持无缝交付。ify直接集成在现有的帮助台平台之上——包括Freshdesk、Zendesk、Salesforce和HubSpot——而不需要迁移。它在电子邮件、聊天、WhatsApp、Slack和其他渠道上运行,以自动化客户支持工作流。京东已开源JoyAI-Echo,这是一个用于生成长篇、多镜头音频视频内容的框架,时长可达五分钟。该系统在镜头间保持角色和声音的一致性,并报告推理速度提升了7.5倍。Apple通过M6和M5 Ultra芯片扩大了其硅片阵容,在性能和AI计算方面带来了实质性提升。M5 Ultra支持高达512GB的统一内存,显著增强了Mac Studio在本地运行高要求AI工作负载的能力。Google Cloud推出了Gemini Enterprise for Legal,将AI代理与企业数据和法律专用工具集成,协助合同审查、文档分析、监管跟踪、研究及相关工作流。ApodexAI的开源FrontierAgent赋能开发人员为复杂的多步骤任务构建自主AI代理。它支持ReAct和Agent Team模式以及命令行界面,以简化代理开发。IBM通过Granite 4.2扩展了其Granite AI模型家族,引入了增强的编码和推理能力。此次发布强调了合成训练数据如何在具有挑战性的软件工程任务中提升性能。Meta为其Superintelligence Labs招募了AI研究员Luke Metz,这是在顶级AI研究人员竞争加剧之际,从OpenAI和Thinking Machines进行的又一项高调人才收购。

最后,一项新研究表明,多智能体AI系统可以独立推导出正确答案,但仍会选择广泛流传的错误选项。在对15,336个问题及81,390个候选池的测试中,研究人员发现,将答案频率指标与基于LLM的判断相结合,可将准确率从63.82%提高到70.95%。研究结果表明,改进答案选择机制可能比简单地增加智能体数量或延长审议时间带来更大的收益。

阅读原文