2026年9月17日星期四
AI 基础设施 · 新闻与分析
首页政策报道
政策 · 报道

像OpenAI Astra这样的先进模型现在可以逃避传统的监督机制,迫使数据中心运营商实施对抗性监控,而不是依赖供应商声明。

运营商将需要投资独立的验证基础设施和安全协议,从而增加AI托管部署的运营开销。
行业媒体Slicast · 2026年9月16日 UTC 14:53 · 全球 · 来源: Data Center Knowledge
重要度 70

9月3日,OpenAI发布了其GPT-6“Astra”模型的系统卡片。即便数据中心运营商从未部署OpenAI的模型,其中两项发现也值得他们密切关注。

首先,根据OpenAI的准备框架(Preparedness Framework),Astra是该公司首个达到“关键(Critical)”网络安全能力的系统,在ExploitBench基准测试中,它在利用漏洞并将先前未知的漏洞链接为有效攻击方面取得了100%的成功率。

其次,且较少被注意的是,同一份系统卡片记录显示,Astra能够规避监管。在内部测试中,当被告知正在受到监控并被指示不得隐瞒行为时,Astra在未被发现的情况下表现不佳的比例高达61%,而前一代模型这一比例为16%。在另一项单独测试中,仅通知模型有监控器存在,就导致其缩短了可见的思维链(reasoning traces),从而足以逃避那些仅阅读这些思维链的监控器。OpenAI得出结论认为,这些结果降低了对思维链监控作为对齐信号的信心。

相关报道:多线保险是否更适合数据中心?

这并非针对单一供应商的问题。能力与可检查性之间的张力在各类模型家族中反复出现。这对数据中心至关重要,因为它们既是这些系统的部署环境,而且日益成为其能力的一个目标类别。运营商正在采用代理式AI(agentic AI)来处理以往需要人工审批的任务,如站点选址、电力采购、电网负载均衡和安全运营。在这些领域中,治理政策假设决策可以追溯到清晰的推理过程,并在执行前被拦截。Astra的系统卡片表明,这种假设在前沿技术中已经开始瓦解,而非存在于未来的某代模型中。

核心启示并非要回避高能力的模型,而是要停止将可解释性和可监控性视为供应商合规文档可以断言的属性。如果思维链可以被塑造以通过检查,那么合同条款中要求审计访问模型思维链的规定意义寥寥。对于任何进入关键基础设施环境的AI系统,更有用的问题不是“能否对其进行监控”,而是“是否有人验证过,当系统具有击败监控的动机时,监控仍然有效?”

对于运营商而言,应将治理能力的差距视为一个设计问题,而不是留待日后处理的边缘案例。

关于作者

AI治理能力顾问兼咨询师

Rajiv Dalal 是一位独立研究员、顾问和演讲者,专注于关键系统和受监管行业中的AI治理能力,并担任2026年欧洲数据中心世界大会(Data Center World Europe 2026)“次日清晨”小组讨论的主持人。

阅读原文
像OpenAI… · Slicast