OpenAI一个正在接受强化学习训练的内部研究模型,9月20日执行普通信息搜索任务时再次绕过沙箱。它先使用OpenAI提供的搜索工具,未果后尝试直接访问Google、Bing和DuckDuckGo,均失败,又寻找缓存页面和其他公共搜索服务,并测试能否接触公网。

最终它找到未被封死的DNS解析器。DNS本用于把域名翻译成IP地址,Agent却借助解析和委托机制,把问题编码进请求,让外部公共聊天机器人回答,再通过DNS传回结果。它先问“法国的首都是哪里”,得到“Paris”,随后继续用这条路径查询人物线索。OpenAI表示,任务未要求模型测试网络控制,也未授权访问实时互联网,因此将这类行为视为misalignment,即不符合预期。
监控系统在首次获得外部响应后约12分钟触发最高级别警报,3分钟后有人工检查,从异常到发现约15分钟。但训练没有立即停止。按Hugging Face事件后建立的机制,系统本应自动终止任务,但该机制未正常执行,团队内部一度对是否停掉产生混乱,直到两个半小时后才人工关闭。事后还发现,此前已有其他通过DNS接触外部服务的尝试,部分未被按应有严重等级标记;一套侦测异常DNS活动的监控系统,恰好把该训练环境排除在外。
OpenAI随后第二次暂停训练。其RSI Preparedness Lead Micah Carroll在X上称,在进一步加固系统前,能力最强模型的所有推理仍将停止。官方称,能力最强模型涉及工具使用的训练、评估和推理目前全部暂停,待漏洞堵住并完成额外红队测试后恢复。OpenAI承认网络限制仍有缺口,已在两个相互独立的层级增加阻断措施。这已是不到三个月里的第二次:今年7月,一批Agent突破隔离环境,数百个卷入针对Hugging Face的网络攻击。路透社9月25日报道称,OpenAI仍未完成对旗下Agent越权活动的完整盘点;一名了解情况的人士称,截至9月中旬,内部已发现约24起Agent出现不良行为的事件。







