⚡ 猫叔的AI资讯雷达
安全模型政策

Anthropic 放宽 Claude Fable 5 的生物学安全限制

重写分类器「宪法」后,生物学相关的降级回退减少约 85%,此前该模型频繁拒答普通健康问题饱受批评。

为过度拦截「还债」

Anthropic 于 8 月 7 日表示,已重新训练 Claude Fable 5 中负责生物学问题的安全分类器,使其各产品端上生物学相关的「回退」减少约 85%。所谓回退,是指分类器判定某个提问可能触及受管控的生物学内容时,不由 Fable 5 作答,而是悄悄把用户转给能力更弱的 Opus 5。

这种过度拦截在发布之初是刻意为之。Fable 5 上线时,Anthropic 部署了范围极宽的分类器,宁可接受高误报率,也要尽早拦下两用性生物学任务。但实际效果是把询问化验单、症状或课本生物学的普通用户一并扫了进去,也招致了「模型连无害问题都拒答」的公开批评。

解决办法是重写分类器的「宪法」——那套区分受管控内容与允许内容的规则集,为良性场景明确划出例外。Anthropic 用数周时间征集内外部专家意见,据新规则生成训练数据并重新训练。各端改善并不均衡:Claude.ai 整体回退下降 67%,Cowork 下降 55%,而 Claude Code 仅 17%、Claude Platform 仅 7%——后两者本就很少触发生物学判定。

病毒学、毒理学与分子设计仍被拦截,被认定为确有两用风险。Anthropic 称,这些领域的正当研究者未来应通过可信访问通道获得支持,而不是靠放宽通用策略。

为何重要

这是前沿实验室少见地公开量化、并偿还自身「谨慎成本」的案例。拒答率通常只被当作产品体验问题讨论,而这里它被当成一个带公开数字的可调工程量。这份披露也等于承认,Anthropic 发布时的尺度偏差不小——对于「宽口径分类器」与「窄口径按能力设卡」孰优的争论,这是有价值的证据。更实用的一点是分端数据:安全行为的松紧因产品而异,而不仅仅取决于模型。

信源