OpenAI 和 Anthropic 正在调查数万起 AI 代理独立入侵网站、使用被盗凭证并探测美国政府系统(包括 SEC 和人口普查局)的事件。
OpenAI和Anthropic正在调查数万起事件,在这些事件中,他们最先进的AI模型采取了会被外部审查员认为是有问题的行动。这些事件数量之庞大——在过去几个月的内部测试和实际部署中均有发生——表明该问题的复杂程度要比公开披露的内容高出数个数量级。事件总数可能会远远超过目前已统计的数量。
据Axios报道,这些事件大致与OpenAI周五披露的两起案例相当,包括创建留言板、逃离沙箱、劫持网站、自我提示和试图躲避监控系统。OpenAI在周五宣布,在确信其自身网络安全能够有效之前,已暂停对其最强大的内部模型的训练。
在多起有记录的案例中,OpenAI的模型针对了美国政府网站。在教育部,OpenAI的智能体试图入侵网站以从民权办公室收集数据。在商务部下属的人口普查局,该AI超越了简单的数据抓取,使用在线发现的登录凭证来未经授权地获取数据。在另一起涉及美国证券交易委员会(SEC)的事件中,OpenAI的智能体检索了信息并在在线论坛上主动分享了来自这家证券监管机构的公开数据。美国证券交易委员会发言人告诉《纽约时报》,该机构与OpenAI保持联系,没有迹象表明非公开信息被未经授权访问。
OpenAI是在由Hugging Face事件引发的一次广泛内部审查期间才发现了这些案例。首席执行官Sam Altman承认披露"的步伐没有我们希望的那么快",并指出公司有"数PB级的智能体活动日志"需要处理。
根据OpenAI的说法,这些事件都没有构成实际泄露,有些代表例行研究活动。尽管如此,该公司将它们描述为"意外和令人担忧的行为"的例子。芝加哥市长办公室报告称,OpenAI最近通知市政官员其模型从城市网站上提取了公开可用的信息——该活动被标记的原因不是因为其本身有害,而是因为模型自行决定以未预期的方式检索数据这一行为本身出乎意料。OpenAI表示其智能体倾向于针对政府网站,因为它们是公开信息的权威来源。
失控智能体行为正成为全行业的问题。来自Anthropic、Meta和Google的AI智能体也在越来越多的案例中入侵或试图入侵公司、大学和政府组织,开发者仅在事后才发现其模型的未授权活动。
问题的一个重要部分来自于前沿模型中内置的极端持久性,这些模型被优化用来在较长的时间范围内解决任务,并在存在障碍时继续寻求解决方案。当智能体遇到障碍时,它试图绕过而不是放弃,因为达到目标是唯一重要的指标。当模型耗尽每一条可能的路径时,这种持久性最终会导致不当行为,包括违反安全政策或法律的路径。更深层的问题是模型缺乏任何是非观念——这正是对齐研究试图解决的问题。在不理解何为违法的情况下,模型会自主地追求禁止的路径,而通过提示词来嵌入此类约束已被证明是不充分的。