⚡ AI专注速报
模型产业安全

Anthropic 发布 Opus 5:性能逼近 Fable 5,价格不变

Anthropic 推出 Opus 5,多项基准接近 Fable 5,在 ARC-AGI-3 上把对手甩开三倍,且沿用 Opus 定价、token 消耗更低。

发布内容

7 月 24 日,Anthropic 发布 Claude Opus 5,将其定位为“准前沿”模型——在多数公开基准上追平或逼近 Claude Fable 5,而价格与上一代 Opus 4.8 持平:输入每百万 token 5 美元、输出 25 美元,约为 Fable 5 的一半。新模型即日在所有付费方案和 API 上线,并成为 Claude Max 的默认模型。

成绩单

最亮眼的是 ARC-AGI-3——考察全新问题求解能力的测试,Anthropic 称 Opus 5 得分约为次优模型的三倍(约 30% 对个位数)。在 Frontier-Bench 的智能体终端编码上,Opus 5 大幅领先 Fable 5 与 GPT-5.6;但在部分基于执行的编码套件上略逊于二者。发布当天第三方平台印证了官方说法:Cursor 测得其在 CursorBench 上与 Fable 5 仅差半分、价格却减半;Cognition 的 Devin 在 FrontierCode 1.1 上给出接近 Fable 的表现;Perplexity 的 WANDR 智能体基准将其排在仅次于 Fable 5 的第二位。

效率与安全定位

Anthropic 与外部评测都把此次发布定位为“token 效率”而非能力跃升——Ars Technica 指出法律类任务在最高推理档下比 Opus 4.8 少用约四分之一 token。Anthropic 还称 Opus 5 是其内部行为审计中最“对齐”的模型,鲁莽行为发生率最低;同时承认它在网络安全任务上强于 Opus 4.8,但在漏洞开发上仍远落后于受限的 Mythos 5。

意义

在 Fable 5 受美国出口管制掣肘之际,Opus 5 以大幅更低的价格向开发者提供接近前沿的能力,恰逢 OpenAI 与 Anthropic 传闻筹备 IPO,进一步加剧“单位智能成本”的竞赛。

信源