2026年10月2日星期五
AI 基础设施 · 新闻与分析
首页 › 头条 › 报道
头条 · 报道

Google在Gemini 3.5 Flash中直接集成Computer Use能力,使模型能够查看和操作屏幕/浏览器,在OSWorld基准测试中得分78.4,与GPT-5.5相当。

Agentic AI 从研究阶段迈向生产模型,推动对 CPU 密集型智能体基础设施和推理容量的需求。
行业媒体Slicast · 2026年6月25日 UTC 09:04 · 全球 · 来源: The Decoder
重要度 86

谷歌已经将"计算机使用"功能直接集成到 Gemini 3.5 Flash 中,使该模型能够自主地查看、理解和与计算机、浏览器和移动设备交互。这项功能之前仅作为单独的 Gemini 2.5 模型提供。

结合函数调用、搜索和地图等现有工具,开发者现在可以构建能够在浏览器、移动和桌面环境中工作的代理。这些代理可以自动化软件测试和办公自动化等任务。

在 OSWorld 基准测试中,Gemini 3.5 Flash 得分 78.4,超过了 Gemini 3 Flash 的 65.1 和 GPT-5.4 mini 的 72.1。GPT-5.5 的排名略高,得分 78.7,而 Anthropic 的 Opus 4.8 以 83.4 的成绩领先该基准。Sonnet 4.6 与 Gemini 3.5 Flash 并列得分 78.4,Gemini 3.1 Pro 得分 76.2。

为了防御提示注入攻击,谷歌采用对抗性训练以及两项可选的企业级保护措施。第一项要求对敏感或不可逆的操作进行用户确认,第二项在检测到间接提示注入时自动停止任务。谷歌还建议实施沙箱隔离、人工监督和严格的访问控制,更多指导可在其最佳实践文档中找到。

计算机使用功能通过 Gemini API 和 Gemini Enterprise Agent Platform 提供。谷歌已发布 Browserbase 演示和 GitHub 参考实现供开发者使用。

阅读原文
Google在Gemini 3.5 Flash中直接集成Computer… · Slicast