Anthropic与埃森哲共建前沿模型内部独立评估机制
Anthropic与埃森哲计划五年各投入至少10亿美元,让评估人员深入实验室开展前沿模型安全测试。
发生了什么
Anthropic宣布与埃森哲旗下AI业务Faculty合作,对前沿模型开展独立评估和红队测试。双方表示,未来五年各自预计投入至少10亿美元,用于建设相关评估能力。
与模型发布后的常规外部审计不同,这一安排将让评估人员进入Anthropic内部,并获得接近员工级别的访问权限。他们将观察模型如何训练、部署决策如何形成,以及安全防护措施如何被选择。工作内容包括对齐评估、模型红队测试和安全机制验证。
Anthropic称,这项合作并非排他性安排,未来还会与更多评估机构合作,包括METR等非营利组织。公司也承认,目前行业尚未形成关于评估人员访问权限、报告方式和长期资金来源的统一标准。
为什么重要
这项合作直面前沿模型安全计划中的一个核心弱点:实验室通常同时掌握模型、测试环境、证据和披露时间。拥有更深访问权限的评估人员,可能更早发现问题,也能核对公司对外承诺与内部实践是否一致。
但这种模式也带来独立性问题。评估工作由Anthropic直接出资,评估人员又进入被评估的公司内部。这种安排能够提供外部审计难以获得的技术访问,却也可能在保密、公开发布和问题升级方面产生压力。
10亿美元级别的投入相当可观,但真正缺少的不是资金,而是治理规则。如果没有统一的访问标准、受保护的报告渠道和利益冲突处理机制,内部嵌入式评估可能只是资源更充足的内部质量保障部门。若这些制度能够建立,这项合作或许能成为实验室自律与政府独立监管之间的现实过渡方案。