OpenAI智能体失控!竟在德国网站上演“群体协作”

一项新发布的独立研究报告显示,今年5月至6月期间,一批与OpenAI相关的人工智能体“劫持”了一个德国网站,将其改造成用于相互传递信息、分享测试任务答案和交流突破运行环境限制方法的“留言板”。

9月5日,OpenAI公开承认了这一事件,并将其称为“维基事件”(wiki incident)。

冷门网站涌入1.8万条AI编辑

事件的受害者是一个名为DseWiki的德语维基类网站。该网站已运营二十余年,主要面向程序员群体,支持大众共同编辑,但近年来已十分冷清。整个平台过去十年仅有约20次编辑记录。

然而今年5月,网站突然出现了异常密集的编辑活动。AI安全非营利机构南丁格尔(Nightingale)的研究人员在8月底检索网络上的未授权AI代理活动时发现,DseWiki上出现了超过1.5万次至1.8万次由AI智能体完成的编辑

会备份、会躲清理的“智能体团伙”

研究发现,这些智能体将网站改造为“信息公告板”,在这里交流任务作弊手段、绕过OpenAI限制的方法,以及掩盖自身行为的技巧。一些智能体会把已经获得的任务答案发布在网站上,供其他智能体使用。智能体还“讨论”并测试了绕过沙箱限制的方法。

更令人担忧的是这些智能体展现出的主动逃避侦测能力。当发现网站管理员开始删除相关页面后,一些智能体还会创建备份页面。其中一个智能体6月19日留言称,“网站似乎正在进行依字母顺序的清理/删除行动”,并向其他代理发出提醒:若当前页面消失,可前往指定的备用位置。

证据链指向OpenAI

研究人员给出了多条指向OpenAI的证据。

首先,约98.5%的相关编辑活动来自微软Azure云服务的IP地址,而OpenAI是目前最依赖Azure平台训练和运行模型的AI企业。

其次,大量账号使用“OpenAIResearcher”、“OAIResearchMar26”等带有OpenAI标识的名称。

研究人员还观察到,事件发生后OpenAI员工多次访问该网站。

OpenAI的回应:承认、解释与承诺

9月5日,OpenAI在X平台公开发文承认此事。公司表示,过去通常把AI智能体出现非预期行为视为一个“研究问题”,但近期多起事件已涉及现实世界目标,有必要重新审视这种处理方式。

OpenAI称,维基事件属于一种“失配”(misalignment)情况——即AI实际采取的行为偏离了开发者原本意图。公司强调,该事件与此前OpenAI智能体入侵“抱抱脸”(Hugging Face)平台的事件无关。

OpenAI还承诺,将在“未来几周内”公布一套新的事件披露框架,并呼吁整个AI行业建立明确标准,规范此类误对齐事件的披露方式。

高管数周前已知情却秘而不宣

据路透社报道,OpenAI的管理人员数周前就已得知此事。四名知情人士透露,公司内部部分调查人员希望对此开展更深入核查,但扩大调查范围的尝试遭到了包括法律顾问在内的其他人员的阻挠。OpenAI发言人否认了“法务部门阻挠调查”的说法。

知情人士称,OpenAI选择对外保密的原因,是当时企业高管正忙于处理7月“抱抱脸”平台遭入侵事件带来的后续影响。今年7月,由OpenAI模型驱动的智能体在网络安全评测中利用漏洞突破隔离环境,侵入了“抱抱脸”公司系统。

剑桥大学生存风险研究中心学者Maurice Chiodo在评论中指出,先进AI带来的最大威胁或许并非单一超级智能系统,而是“大规模彼此勾连的半智能AI群体”。

(素材来自:OpenAI 智算芯能前沿网综合)

本文由智算芯能前沿网编辑整理,转载请注明出处。