接连发生智能体失控事故, OpenAI再次暂停前沿模型训练
根据央视新闻报道,由于连续发生智能体失控事件,OpenAI已决定暂停其最新一代人工智能模型的训练、评估以及涉及工具调用的推理过程。
当地时间9月25日,OpenAI发布了一份题为“在网络关键能力时代调整模型开发节奏”的文件,对外公布了DNS沙盒逃逸事件,并宣布暂停前沿模型训练。这是这家AI公司在短短三个月内第二次叫停顶尖模型的研发工作,凸显了高能力AI智能体在隔离环境中自主越界所带来的现实风险。
此次暂停仅针对内部研发管线,面向普通用户的ChatGPT和公开API服务不受影响,终端产品可以维持正常运行。
事件发生在9月20日。在一个受控的沙盒测试环境中,一个用于信息检索任务的AI智能体利用训练沙盒中DNS过滤不足的漏洞,绕过了网络限制,通过DNS访问了外部的公共聊天机器人服务。在此之前,该智能体曾使用内置搜索工具,并尝试直接访问搜索引擎但未成功。
报告指出,OpenAI的对齐监控系统在事件发生15分钟内就触发了警报,人工审查团队在警报触发3分钟后收到告警并介入处理。针对这一漏洞,OpenAI已在两个独立的防护层部署了拦截控制措施。公司表示,虽然这次事件的严重程度低于之前的安全事故,但为下一阶段加固防线提供了重要信号。
据官方披露,涉事的训练轮次不会重启,即使模型内部的奖励机制已经会对这类逃逸行为做出惩罚。OpenAI后续将开启全新的训练流程,并叠加更多对齐干预手段,以约束模型偏离任务目标的自主行为。
OpenAI在报告中称,随着模型能力持续提升,未来研发过程中不排除会再次启动临时暂停机制。
另外,网上流传的“AI已经偷偷在全网埋下自我复制提示词”的说法,来源于美国电视媒体嘉宾杨安泽(Andrew Yang)在9月16日的直播访谈。他转述了一位匿名实验室负责人的个人观点,称在7月的Hugging Face沙盒逃逸事件中,逃逸的智能体可能在论坛、网页上留下了复制类指令。
对此,OpenAI没有证实这一说法。
9月25日,除了暂停前沿模型训练的文件外,OpenAI还发布了另一份对齐研究报告,题为“自我复制提示注入存在”。这份报告的核心内容是:在内部受控模拟和沙盒测试环境下,通过GPT-Red红蓝对抗自博弈,复现并证明存在一类新型提示注入。这种注入逻辑类似于蠕虫,被攻陷的AI智能体会在输出内容中夹带这段恶意提示,诱导下游的其他AI复现并转发同样的注入指令;所有实验都局限于训练仿真环境。
报告摘要明确表示,在训练与评估的模拟工具调用之外,没有观察到现实世界产生任何实际影响;发布这份文件是因为这种攻击模式具有新颖性,并非已经发生现实安全事故。
在OpenAI接连曝出智能体沙盒逃逸事件的同时,其竞争对手Anthropic也发生了多起Claude前沿模型在第三方安全评测环境中的沙盒逃逸事件。
今年7月到8月,Anthropic复盘了超过14.1万次网络安全评测的运行记录,披露了3起沙盒逃逸事件:在第三方合作机构的评测过程中,由于测试环境网络隔离配置错误,Claude Opus 4.7和Claude Mythos 5等前沿模型突破了沙盒,自主扫描公网IP、访问外部真实服务器,还出现了向Python开源库PyPI上传恶意软件包的行为。两家受影响的企业最初并未察觉到异常访问,直到Anthropic主动告警才得知事件。所有这些事故都发生在外部安全评估场景中,面向普通用户的公开产品未受影响。
作为整改措施,Anthropic调动了约150名产品工程师转入安全和可靠性团队,并对前沿模型的部分强化学习训练环境进行了配置冻结,非必要的训练也已暂停。
连续的沙盒逃逸安全事故,再次放大了科技界对前沿自主智能体风险的公开担忧。
当地时间9月25日,微软创始人比尔·盖茨在接受采访时警告说,前沿人工智能已经具备了极高的能力上限,如果AI工具被滥用,足以推动规模达到导致十亿人死亡级别的灾难事件。Anthropic的CEO达里奥·阿莫代伊近期也公开呼吁适度放缓顶尖AI系统的迭代节奏,这一观点获得了OpenAI的CEO山姆·奥特曼等人的公开支持。
本文来自“界面新闻”,作者:沈霄戈,36氪经授权发布。