⚡ AI专注速报
研究Agent

METR 提出「支出地平线」,用美元给智能体与人类定价

METR 的新指标测算智能体在多大预算之下还比人便宜——目前只有最新几款模型算得出这个数,且仅在四位数低位。

把能力换算成钱

评测机构 METR 7 月 27 日发布新指标,把智能体能力重新定义为一个预算问题。它不问模型能否完成任务,而问:在一个智能体上砸多少钱之后,请人来买同样幅度的改进反而更划算。这个门槛之下智能体在成本上取胜,之上就该招人。

数据来自 NanoGPT speedrun——一个社区基准,参与者比拼把小语言模型的训练时间压得更短。按 METR 的折算,人类贡献者每换取 1% 的加速大约投入 2500 美元的工作量。以此为基线,只有最新的前沿系统(METR 实测中为 GPT-5.5 与 Opus-4.8)才算得出有意义的支出地平线,而且落在四位数的低位。这项 speedrun 背后的人类总投入估计约 25 万美元,自主 AI 的贡献只推动了其中很小一部分。

数字之外还有一个定性结论:智能体产出的想法约七成在技术上可以接入,但大多缺乏原创性——是已知技巧的重新组合,而不是带来最大增益的那种新招。

明确的局限

METR 只测了完全自主的优化过程,而真实研究并非如此进行。该机构也指出,人加 AI 的组合有时表现还不如人单干,而这个指标对哪种协作方式有效完全没有说法。

为何重要

智能体能力此前几乎只用评测百分比来争论,而百分比无法告诉采购方一个任务该配多少算力。以美元计价的地平线把前沿进展变成了一个采购数字,还能跨版本追踪——如果这个数从四位数爬到五位数,自动化边界就真的动了,与任何评测分数无关。而当下的读数对「AI 自动化研发」的说法是个降温:在一个真实且被高度竞争性优化过的研究任务上,自主智能体只在多数实验室一个下午就能花掉的预算内比人便宜。

信源