Grok 4.5推理成本低于Fable 5和GPT-5.5 4.2倍,尽管部分基准测试性能落后;效率分析突出成本-质量权衡。
xAI发布了Grok 4.5,该模型在数万个英伟达GB300 GPU上训练,用于编程、智能体任务和知识工作。
基准测试结果呈现出喜忧参半的局面。在Terminal Bench 2.1上(测试复杂命令行任务),Grok 4.5得分83.3%,几乎与GPT-5.5的83.4%持平,仅比Anthropic的Fable 5的84.3%低一个百分点。但在其他地方差距扩大。在DeepSWE 1.1上(衡量解决真实GitHub问题的能力),Grok 4.5达到53%,远低于GPT-5.5的67%和Fable 5的70%。在SWE Bench Pro上(精选的更难的软件工程问题集),Grok 4.5得分64.7%,在某些配置下超过Opus 4.8,但Opus 4.8在最大设置下达到69.2%,而Fable 5则为80.4%。
xAI表示,在训练过程中,它依靠大量数据过滤、去重和领域特定选择来维持数据质量。强化学习阶段涵盖了数十万个软件工程任务,配备自动评分。xAI为异步学习构建了训练基础设施,允许智能体运行持续数小时,同时训练并行进行。
Grok 4.5的定价为每百万个输入令牌2美元、每百万个输出令牌6美元——远低于竞争对手。Opus 4.8每百万令牌的输入和输出费用分别为5美元和25美元;Fable 5每百万令牌的输入和输出费用分别为10美元和50美元;GPT-5.5和GPT-5.6分别为5美元和30美元。
xAI还表示,在SWE Bench Pro任务上,Grok 4.5比Opus 4.8少用4.2倍的令牌,并以每秒80个令牌的速度交付结果。结合更低的单令牌定价,假设性能和效率收益在实践中能够保持,Grok 4.5成为该性能层级迄今为止最便宜的选择。
这一定价策略呼应了Zhipu和DeepSeek等中国厂商一直在做的事情:在性能上足够接近,然后以价格赢得市场。
Grok 4.5现已通过Grok Build、Cursor和xAI控制台提供,Word、PowerPoint和Excel的插件已上线。该模型在欧盟暂未提供,xAI计划7月中旬推出。xAI在与代码编辑器Cursor一同训练Grok 4.5,而SpaceX在6月中旬以600亿美元股票收购了Cursor。