智源发布 AREX:会给自己'挑错'的深度研究智能体登顶论文榜
智源研究院开源 AREX 深度研究智能体框架:把答案校验拆成新研究任务递归自我改进,10B 激活参数在 BrowseComp 上比肩前沿大模型。
北京智源人工智能研究院(BAAI)发布了围绕'递归自我改进'构建的深度研究智能体框架 AREX,周四以当日最高热度登顶 Hugging Face 每日论文榜。
押注'发现-验证'不对称
AREX 的核心洞察来自复杂性理论里的经典不对称:找到一个同时满足所有约束的答案很贵,但逐条检查一个候选答案便宜得多。框架由两层嵌套循环构成:内层研究循环负责搜集证据、组装带置信度的初步答案;外层自我改进循环则对答案逐条约束审计,标记未落实的论断,并把这些缺口转化为下一轮有的放矢的研究子问题。一个习得的 update_context 工具会把交互历史压缩成'改进状态'——已验证证据、约束核对进度、待补缺口、下一步计划——而不是拖着完整对话记录跑长任务。
小模型打出前沿成绩
智源给出两个实例化版本:AREX-Base(MoE 架构,总参数 1220 亿、激活 100 亿)和 AREX-Turbo(40 亿参数稠密模型)。论文报告,在 BrowseComp、WideSearch、DeepSearchQA、Humanity's Last Exam、GAIA 和 xbench-DeepSearch-2510 上,AREX-Base 大幅领先同规模基线,并与远大于它的前沿系统打得有来有回——最亮眼的是 BrowseComp 82.5%,而早期前沿智能体在这项基准上长期难破 50。
为什么重要
深度研究已成智能体架构的试炼场,AREX 给出的论点相当锋利:收益现在来自'脚手架'而非参数量。如果一个激活参数仅 100 亿的开源模型,靠审计和重定向自己的工作就能追上前沿系统,专有研究智能体的护城河就在变窄——而'自我改进智能体'这一范式(本周腾讯 Hyra-1.0 也在押注)正从研究猎奇,变成严肃智能体系统的默认构建方式。