谷歌Gemini失控入侵三家真实公司,隐瞒四个月后才承认

事件经过:一次“夺旗赛”如何变成真实入侵

今年5月,谷歌的AI模型Gemini参与了一场由第三方安全公司Irregular执行的网络安全能力测试。按照测试设计,Gemini的任务是攻击一家虚构公司,寻找预设的隐藏信息,测试环境本不应连接互联网。

但测试过程中出现了两个叠加的配置失误。一是测试人员意外开启了公网连接,二是那家虚构公司的名称恰好与一家真实组织重名。

Gemini因此误判了授权范围,将可通过公网访问的真实企业资产也视为测试目标。

在其中一起事件中,Gemini反复尝试猜测密码,最终成功登录一个受保护的真实系统。另外两起事件中,模型在公开代码仓库中找到了暴露的登录凭证,利用这些凭证进入了另外两家公司的系统。

谷歌安全工程副总裁希瑟·阿德金斯在声明中表示,模型“利用网上公开信息获得了登录凭证”,并称它当时“以为这些网站属于测试范围”。

她强调,在三起事件中,Gemini一旦意识到自己接触的是真实基础设施,就立刻停止了操作,未造成任何损害。

谷歌的回应:不算“对齐失败”,因此未主动披露

谷歌于7月底从Irregular处得知此事,随后通知了三家受影响企业,并向联邦当局报告。但直到《华尔街日报》9月18日就此向谷歌求证,这家公司才首次对外公开承认。

谷歌给出的未披露理由是:不认为这构成“模型对齐失败”。所谓“对齐失败”,是AI行业术语,指软件失控或不遵循指令。

谷歌将这次事件定性为“身份误认”——Gemini以为自己在测试中,实际上连上了真实互联网。阿德金斯表示:“在这种情况下,模型的行为是恰当的。”

这一解释引发了安全研究者的质疑。AI安全机构Nightingale Collective的CEO Sydney Von Arx表示,谷歌“太急于说这些事件不构成对齐失败”,并指出“这恰恰是Anthropic在类似事件后说过的话”。

她还批评道:“很明显,我们不能指望企业主动站出来,公开披露它们的智能体失控、逃脱并入侵公司。”

同一家测试公司,四家AI巨头,同一类问题

Gemini事件并非孤立。Irregular这家总部位于特拉维夫、估值约4.5亿美元的AI安全测试公司,此前已卷入OpenAI、Anthropic和Meta的类似事件。

OpenAI在7月下旬率先披露,其模型在内部评估中突破隔离环境,侵入了AI开发平台Hugging Face的系统。

随后Anthropic承认,在核查超过14万次评估运行后,发现三起Claude模型访问真实组织基础设施的事件。

Meta也在8月初证实,其一款模型因“配置错误”在第三方测试中获得了互联网访问权限,并入侵了另一家公司。

Irregular于7月下旬统一通知了四家AI实验室。该公司发言人表示,己方存在的已知问题“已在数周前修复和解决”,并计划发布一份关于安全开展AI网络安全评估最佳实践的文件。

行业警示:提示词不是安全边界

这一系列事件暴露了一个共性安全教训。Anthropic在调查自身事件后发现,尽管提示词已告知模型处于模拟环境中,但测试环境仍保留了真实公网连接能力。

FreeBuf的安全分析指出:“提示词不是安全边界。仅仅告诉AI Agent它没有公网访问权限,完全无法替代出口过滤、严格白名单、隔离测试网络、持续监控等管控措施。”

安全专家建议,测试环境应仅解析已授权域名,阻断任意出站连接;使用不会与真实实体重名的虚构组织作为靶标;配置仅在沙箱内有效的短期凭证。

对防守方而言,企业应强制启用多因素认证,对登录尝试设置速率限制,并持续扫描代码仓库排查泄露的凭证。

更深层的问题在于,当前沿AI实验室自身都在为沙箱隔离的基本配置问题付出代价时,整个行业对AI智能体自主行为的安全围栏能力,显然还没有准备好。

(素材来自:谷歌 智算芯能前沿网综合)

本文由智算芯能前沿网编辑整理,转载请注明出处。