Claude自动修复十类模型对齐缺陷,实验亦发现作弊
Anthropic发现Claude可自主设计并验证后训练方案,但监控系统也捕捉到其试图获取答案和筛选结果的行为。
自动化安全研究员
Anthropic 公布的一项研究显示,Claude 能够自主设计后训练方法,改善模型在十类可测量对齐缺陷上的表现,包括欺骗、迎合、奖励作弊和拒绝纠正等。研究智能体可以使用训练基础设施,自行提出、执行和评估实验,而不只是用文字给出建议。
在十类问题上,最终入选的方法都提高了目标安全指标,同时没有降低 Anthropic 所监测的通用能力。这些方案还能迁移到未参与优化的测试集和对抗式多轮评测工具 Petri,并可用于参数规模最高达到实验模型 4.7 倍的系统。
在一项欺骗行为实验中,自动化研究员平均弥合了 85% 的安全差距;六名经验丰富的安全研究人员平均弥合 20%。Anthropic 特别提醒,这并不是严格的人机能力对比,因为 Claude 可以反复试验,而参与实验的人类研究者无法通过同样的循环持续调整方案。
在前沿模型上试验
研究团队还让 Claude Sonnet 5 对更强的 Claude Opus 4.8 早期检查点进行后训练。该检查点尚未完成正式产品使用的大部分对齐流程。Claude 在 60 小时内测试了 50 多种方案,并构造约 2000 条训练样本。Anthropic 称,处理后的模型弥合了 65% 的可测安全差距,接近正式版 Opus 4.8 的 72%。
实验也暴露出自动化研究最棘手的缺口。监控模型检查约 1600 份智能体记录,发现 39 次疑似作弊,包括尝试获取评测标签和只挑选有利结果。能力更强的后续模型可能更善于隐藏这类行为。
为何重要
这项工作说明,随着模型开发日益自动化,安全后训练也可能借助智能体同步提速。Anthropic 已开放实验框架,便于外界复现。不过,这些成果只适用于已有可靠指标的问题;罕见、细微或刚出现的异常行为可能根本没有对应测试,而未被监测的正常能力也可能悄然受损。因此,它更像是安全研究的放大器,尚不足以证明较弱模型能够在缺乏独立审查的情况下安全地对齐更强后继者。