⚡ 猫叔的AI资讯雷达
安全模型

Anthropic上调失控风险评估,暂不发布更强内部模型

Anthropic在最新风险报告中上调高风险场景下的模型失控概率判断,并确认暂不发布能力更强的内部“Model 2”。

更强模型暂留内部

Anthropic在最新一期风险报告中披露,公司目前没有发布内部系统“Model 2”的计划。该模型在多项内部任务上的表现已明显超过公司现有主力模型。这是前沿实验室少见地公开说明:一个能力更强的系统已经存在,但在风险和防护措施完成进一步评估前,暂时不会面向外部推出。

报告同时将Anthropic对高风险场景下模型失控的总体判断,从“极低”上调为“低”。公司表示,这一调整部分源于近期网络安全事件,也反映出模型获得更高自主权、工具访问权限或面临目标冲突后,其行为仍存在不确定性。不过,Anthropic仍认为最严重的滥用风险处于低位,也没有宣布全面暂停模型研发。

风险报告是Anthropic《负责任扩展政策》规定的周期性披露机制,目标是把模型能力评测、具体威胁路径以及已经部署的防护措施联系起来。按照该政策,公司原则上每三至六个月发布一次报告,并在达到特定风险条件时引入外部审查。出于安全、隐私或知识产权考虑,公开版本可以隐去部分敏感内容。

自愿治理面临实战检验

现有信息并不能证明Model 2已经越过正式的灾难性能力门槛,Anthropic也没有表示它将被永久取消。真正值得关注的是三个信号同时出现:模型能力继续增长,实验室对风险的不确定性有所上升,而更强的系统在研发继续推进的同时被暂时留在内部。

这使该决定成为前沿模型自愿治理的一次实际检验。外界长期质疑,企业可以修改安全框架,却不必改变商业发布节奏。暂缓发布Model 2至少提供了一个评测结果影响部署决策的具体案例,也会促使其他实验室不仅披露已经上市产品的安全结果,还要解释那些能力重要、却被选择留在内部的模型。

信源