9月18日,Anthropic与埃森哲联合宣布,将共同组建一支“嵌入式评估员”团队,直接与Anthropic内部团队及安全合作伙伴并肩工作。
该团队将由埃森哲旗下专业AI业务部门Faculty牵头,负责对模型进行评估和红队测试,开展对齐评估,并测试模型的安全防护措施。
各出10亿,五年建成评估能力
根据双方公布的计划,Anthropic和埃森哲各承诺在未来五年内投入至少10亿美元,用于建设相关评估能力,合计计划投入至少20亿美元。
双方在公告中明确,这是预期投资承诺,并非已完成支付或保证结果。Anthropic表示,将直接为埃森哲在这项初始合作中的工作提供资金。
埃森哲方面表示,其团队将带来AI、安全和行业专业知识。Anthropic则将这支团队描述为与内部团队及现有安全合作伙伴一起工作。
什么是“嵌入式评估”
Anthropic将这一模式称为“嵌入式评估”。与仅从外部审查模型不同,评估员将获得与内部员工相当的访问权限。
根据Anthropic的公告,这种权限可以让评估员观察模型如何被开发和部署,评估安全承诺的落实情况,并识别盲点。
Anthropic同时强调,这一安排并不转移模型安全的责任——公司仍然对自己的模型负责。
Anthropic将这一合作定性为非排他性的,并表示预计将与其他评估机构合作,同时埃森哲也可以与其他AI开发商合作。
尚待厘清的细节
双方已公布合作方向和资金计划,但评估员的访问权限标准、报告机制和资金安排等具体细节尚未最终确定。
TechCrunch报道称,这项合作是Anthropic近期公开承诺“将外部评估员引入实验室”的第一个具体步骤。
对于关注模型治理实践的团队而言,下一个重要证据将是:访问权限如何界定、评估员可以披露什么、以及评估发现是否能带来安全防护措施的可观察变化。
这份公告确立了一种新的评估运营模式,但它本身并不能证明任何特定安全措施的有效性。
(素材来自:Anthropic 智算芯能前沿网综合)
本文由智算芯能前沿网编辑整理,转载请注明出处。
