⚡ AI专注速报
模型研究

OpenAI:换评测框架后 Sol 的 ARC-AGI-3 冲到 38.3%

OpenAI 称 GPT-5.6 Sol 改用自家 Responses API、开启保留推理与上下文压缩后,ARC-AGI-3 成绩从 7.8% 跃升至 38.3%。

同一个模型,换了"管道"

OpenAI 公布了一组实验,主张 GPT-5.6 Sol 在 ARC-AGI-3 上的糟糕成绩,很大程度上是评测跑法造成的假象。在官方统一评测框架里,该模型只拿到 7.8%——因为每走一步后推理过程即被丢弃,上下文靠截断而非摘要来管理。改用 OpenAI 自家的 Responses API 重跑同一套题,并打开两个开关(跨步保留推理、以压缩代替截断),分数升至 38.3%,高于本周早前 Claude Opus 5 的 30.2%。OpenAI 称公开题集上的相对涨幅达 188%,并把结论推向更一般的层面:一个基准分衡量的从来不只是模型,还包括一整套不易察觉的框架与 API 选择。

ARC Prize 划出边界

ARC Prize 联合创始人 François Chollet 回应时区分了两类改动:为攻榜专门定制的评测框架属于违规;而所有 API 用户都能开启的通用设置则不算,前提是把设置与相应成本一并披露。他承认这会带来厂商之间的可比性问题,但认为透明报告是可接受的补救。官方榜单刻意不启用厂商专属能力,以保证每个条目跑法一致——按 OpenAI 的说法,这一设计恰恰让自家模型因标准框架用不到的能力而吃亏。

为何值得关注

ARC-AGI-3 考的是模型能否在没有说明的情况下上手陌生的二维小游戏,正是那种步数极长、推理连续性会不断累积收益的任务。因此仅靠配置就出现五倍量级的摆动并非细枝末节:它意味着公开的智能体分数,只有在同时注明评测框架、记忆策略与 token 开销时才具备可比性。企业若仅凭榜单差值在前沿模型间取舍,实际上比较的既是模型能力,也是集成方案。可以预见,基准维护方将被要求为每个模型报告多套配置,实验室也将被要求说明某个亮眼数字究竟由哪些 API 特性支撑。

信源