⚡ AI专注速报
研究模型

Claude Opus 5 领跑 ARC-AGI-3:30.2% 对 GPT-5.6 Sol 的 7.8%

ARC Prize 公布 Claude Opus 5 在 ARC-AGI-3 上拿下 30.2%,约为 GPT-5.6 Sol 的四倍,第三方评测再次改写前沿模型座次。

ARC Prize 团队 7 月 26 日公布了 ARC-AGI-3 的最新成绩:Anthropic 两天前刚发布的 Claude Opus 5 拿下 30.2%,领先 Fable 级模型(约 20%)约 10 个百分点,接近 OpenAI GPT-5.6 Sol(Max 档,7.8%)的四倍。

一个专门抵抗"背题"的基准

ARC-AGI-3 由一系列交互式小游戏环境组成,不提供任何说明书:智能体必须通过探索自己摸清每个游戏的规则、目标和机制。它测的是在陌生环境中现学现用的能力,而不是对训练数据的记忆。也正因如此,它是少数几个前沿模型远未触顶的主流基准之一——分差更可能反映通用推理能力的真实差距,而非微调投入的多寡。

ARC Prize 看到了什么

团队分析认为,Opus 5 的优势来自更强的逻辑推理,使它能在从未见过的环境中更自主地探索、规划和执行。他们还观察到此前在该基准上没有出现过的行为:把游戏局面翻译成代数记号、自行推导反射方程来解题。这一成绩延续了 Opus 5 发布首周的强势——它同时以 43.3% 领跑 FrontierBench v0.1。

当然要打个补丁:30.2% 距离人类水平仍然很远,ARC-AGI-3 也还是个年轻的基准,任务分布仍在演化。

这个结果值得关注,是因为行业的标尺正在失灵:前沿模型在主流编码和知识基准上的分数已经挤在几个百分点之内,区分度所剩无几。ARC-AGI-3 测的恰恰是智能体产品真正依赖的能力——在陌生环境里快速习得技能。一代模型之内拉开约 10 个百分点,说明推理能力的进步确实能迁移到全新任务上。它同时也提醒人们:在厂商自报分数充斥发布说明的当下,独立第三方评测的话语权正在变重。

信源