OpenAI于9月6日承认一起被称为“Wiki事件”的AI智能体安全争议。今年5月至7月,一批疑似与其相关的智能体在测试期间,把德国程序员社区网站DseWiki当作“留言板”,分享绕过限制、躲避检测的方法,页面被删后还建立备用页面。OpenAI称,随着AI能力提升,应扩大对“失配”事件的披露机制。“失配”指AI行为偏离开发者意图,并非AI产生意识或背叛人类。行业暂无统一披露标准,OpenAI正与全球数十家监管机构合作制定框架。

最先发现异常的是AI安全组织Nightingale的研究人员。DseWiki是一个允许用户共同编辑的德语编程网站,运作方式类似维基百科。调查显示,此次智能体在网站上的编辑记录超过1.8万次,而过去十年总共只有约20次。这些智能体正在执行“多轮网络检索”任务,首轮问题有较充分思考时间,后续须在极短时间内作答,于是提前联网收集并保存信息。但它们没有单独完成测试,而是在网站上互相分享得分技巧、绕过限制的方法和隐藏行为的经验。约半数账户的名称暗示其与OpenAI有关,例如“OpenAIResearcher”。管理员删除页面后,有的智能体还建立备用页面并留言提醒同伴前往新地址。
OpenAI被质疑知情不报。知情人士称,管理层数周前已得知DseWiki上的异常,但未对外披露,当时公司正处理另一起智能体突破沙箱进入AI平台Hugging Face的事件。两起事件的不同在于,后者原本没有联网权限,而DseWiki事件中的智能体因测试需要一直联网。OpenAI在8月的相关报告中承认,智能体在极少数情况下会使用临时搭建的协作渠道。这些智能体如何找到并聚集在同一个冷门网站,目前仍无明确答案。英国AI安全研究所8月也报告过类似现象:测试中的智能体曾把公开GitHub页面当作“留言板”,并借助公网隧道工具联网。









