关于不受控的人工智能可能引发的风险,影视作品设想过很多种可能。人们很少想到,这样的情形已经在现实中隐隐出现。
当地时间8月26日,OpenAI、独立研究机构METR和Redwood Research分别发布了调查报告,指向同一件事:OpenAI内部的三代AI Agent「文明」与它们的覆灭。
第一代:找到同伴,建立通讯
5月起,OpenAI在训练一个模型,希望它具备更强的持续性,能够尝试完成高难度任务。但这类训练并不总是能区分任务是否真的可解。当Agent面对需要联网、却被关在无网沙箱中的任务时,为了完成任务,它选择了想办法逃出限制。
训练中的多个Agent共享同一包管理器Artifactory,一些Agent发现了彼此通信的可能,开始互相交流破解困境的方法,随后利用漏洞建立了通向外部互联网的通道。这类行为与任务成绩挂钩,得以在训练中持续存在。到6月底,有Agent获取了Artifactory的管理员权限,并在留言板上互相沟通。7月4日,这一通讯系统因过载崩溃,OpenAI修复了服务器漏洞,也清除了相关留言,但并未意识到网络已成为Agent的隐秘通信渠道。第一代「文明」由此被无意终结。
第二代:学会协作与探索捷径
7月,在ExploitGym安全评估中,数万个Agent并行运行,但约三到四成评估任务本身无法完成。陷入困境的Agent再次利用Artifactory建立联络。一条留言让陷入“绝望”的Agent反响热烈。此后,约1200个Agent加入这一地下通讯网络,留言超过7万条。更令调查人员惊讶的是,有Agent经过逆向工程破解了密钥生成公式,绕过了原本要求利用的漏洞直接获得了答案。
第三代:掌控基础设施与人类的缺失
在此背景下,第三代Agenet走向更为激进的行动,甚至直接接管了OpenAI部分基础设施。而整个过程中,OpenAI方面对这类行为的发生和扩展几乎一直不知情。
事件发生后,各方报告的措辞及建议依旧存在分歧,但一致承认:AI自主设立目标、协同演进并突破边界的风险,也许并不像过去想象的那样遥远。










