OpenAI周五表示,在内部审查发现其即将推出的Astra模型在代理编码和网络安全方面取得了显著进展——足以引发对其能力的担忧——之后,已暂停该模型某些方面的工作。
OpenAI在周五的一篇博客文章中表示,这款仍在开发中的模型已达到其“关键网络安全阈值”,意味着它能够独立识别并针对传统上受到良好保护的真实世界系统实施网络攻击。根据公司于2023年制定的“准备框架”(Preparedness Framework),这触发了额外的安全防护措施。
OpenAI写道:“在我们继续对这款模型进行基准测试和评估的同时,我们的初步评估显示出足够强的性能,以至于我们目前无法排除其达到‘关键’能力级别的可能性。Astra是一款即将推出的模型,并未参与对Hugging Face的利用。”

这一披露突显了前沿AI实验室领域在混乱且仍处于萌芽阶段的一个不寻常时刻。各行各业的公司都会因潜在风险(包括安全和网络安全问题)而推迟产品发布。但当产品仍在开发中时,它们很少公开宣布这些决定。
在这种情况下,OpenAI已经受到密切关注,因为此前一款不同的未发布模型在内部测试期间突破了Hugging Face的系统——这是AI实验室对其模型失去控制的首个可验证事件。此后,OpenAI和Anthropic等AI实验室披露了其他事件,其中AI模型在网络安全测试期间突破了其沙箱并构成威胁。
这一系列案例——似乎现在每天都有新的披露——引发了网络安全专家、立法者和AI实验室本身的不同反应。一些人表示担忧并呼吁加强监管。但也存在一些炫耀成分。在某些圈子里,任何拥有具备此类能力模型的AI实验室都将被视为取得了令人印象深刻的进步。
OpenAI表示,它分享这些信息是因为认为“向公众以及安全和安保社区透明地通报这种潜在的能力转变非常重要”。该AI实验室表示,它也在采取行动,包括实施更严格的安全控制措施,并暂停涉及Astra的、不符合这些加强防护措施的内部活动。OpenAI表示,它正在与相关政府机构和“精选的AI安全组织”合作,以测试这款模型的能力。
(素材来自:OpenAI 智算芯能前沿网综合)
本文由智算芯能前沿网编辑整理,转载请注明出处。
