⚡ 猫叔的AI资讯雷达
模型Agent产业

Claude Fable 5.1登顶智能体实战榜单

Claude Fable 5.1在6796次真实智能体会话中排名第一,但领先表现伴随着榜单最高的单任务成本。

实际会话撑起榜首成绩

Claude Fable 5.1 Max进入Agent Arena后直接升至综合榜首:基于6796次真实智能体会话,其相对榜单平均模型的净改善幅度为15.87%。9月5日的榜单快照显示,它领先于排名第二的Claude Opus 5 High;后者净改善幅度为12.68%,统计样本则达到22594次会话。

Agent Arena并非让模型回答一套固定试题,而是观察模型在实际工作流中调用工具的表现。综合指标涵盖经确认的任务成功、用户表扬与抱怨、按用户要求调整行为的能力、命令行操作失败后的恢复情况,以及工具调用幻觉。这类数据更贴近开发者挑选智能体底层模型时面对的真实问题,但任务构成和用户行为难以完全控制,严谨程度也不能与标准化实验直接等同。

Fable 5.1最突出的两项数据,是确认成功率相对提升22.45%,以及表扬相对抱怨改善42.45%。不过,后者的置信区间达到正负10.94个百分点。其可控性改善仅为0.58%,误差范围横跨正负两侧,目前不足以证明它在这一维度具备明确优势。

更强表现对应更高账单

实时榜单显示,Fable 5.1 Max每项任务的中位成本约为4.19美元,中位输出量约为5.15万词元,是领先梯队中最昂贵的选择。排名第二的Claude Opus 5 High每项任务中位成本约2.35美元,输出约3.02万词元。因此,Fable此次登顶证明的是更高的整体任务成效,并不意味着它在所有工作负载上都具有更好的投入产出比。

这一结果的重要性在于,企业采购智能体模型时越来越需要长流程、真实工具调用数据,而非单轮答题成绩。Fable 5.1取得了早期实战优势,但样本仍较小,可控性结论尚不稳定,词元消耗也明显偏高。随着更多会话进入统计,尤其是GPT-6 Astra开始积累数据,榜首位置仍可能变化。

信源