第三方评测:Qwen3.8-Max 登顶智能体分榜,代价是成本翻倍
Artificial Analysis 放出阿里 2.4 万亿参数旗舰的完整测评:综合排名前五、智能体能力第一,但 token 消耗与单任务成本同步飙升。
成绩单
8 月 6 日,Artificial Analysis 公布了对 Qwen3.8-Max 的完整评测。该模型是阿里数日前通过 API 开放的 2.4 万亿参数旗舰。综合智能指数——由 GDPval-AA、Terminal-Bench、SciCode、Humanity's Last Exam 等九项评测加权而成——得分 56,远高于同类推理模型 32 的中位数。阿里 Qwen 团队称这一成绩让模型位居总榜第五、智能体分榜第一,若属实,这是中国模型首次在该分项登顶。
在对标真实知识工作的 GDPval-AA 上,Qwen3.8-Max 拿到 1739 Elo,高于月之暗面 Kimi K3 的 1685,与 Claude Fable 5 的 1743、GPT-5.6 Sol(max)的 1730 基本持平,仅次于 Anthropic 的最高配置。
代价
分数是靠"多干活"换来的。在 GDPval-AA 上,该模型平均每个任务用掉 64 轮交互,上一代仅 14 轮;整个指数评测生成约 1.5 亿输出 token,而中位数是 6600 万——即便按推理模型的标准也算冗长。成本随之上升:单个智能指数任务 1.14 美元,是 Qwen3.7-Max(0.53 美元)的两倍多,约为开源权重领跑者 Kimi K3(0.86 美元)的 1.3 倍。
有一项指标明显倒退。衡量"答对减去自信答错"的 AA-Omniscience 从 +14 跌至 +4,回落约 10 分。原始准确率基本持平在 31% 左右,说明退步来自模型在该弃答时反而给出了断言,把上一代好不容易换来的校准优势又还了回去。
为什么重要
厂商自评的成本很低,带成本与 token 明细的第三方复跑并不便宜。这份结果印证了阿里在智能体任务上已基本追平美国前沿实验室,同时也显示账单一起被推了上去——中国旗舰不再天然等于便宜的选项。更值得警惕的是幻觉指标的倒退:动辄几十轮串联的智能体系统会把"自信的错误"层层放大,校准问题正在成为比分数更硬的部署约束。