⚡ 猫叔的AI资讯雷达
Agent研究

英伟达AVO完成ARC-AGI-3全部公开关卡

英伟达称其通用编程智能体完成ARC-AGI-3的183个公开关卡,智能体框架对最终表现的作用进一步凸显。

公开环境取得满分

英伟达表示,其AVO编程智能体完成了ARC-AGI-3全部25个公开环境、共183个关卡,得分达到100%。这项交互式评测由一组陌生的视觉游戏组成,不会直接告诉智能体目标;系统需要通过探索、反馈和连续操作自行推断规则。

AVO被定位为通用编程智能体,并非专为某个游戏评测训练的单一模型。它会持续观察环境、制定计划、编写或修改解决方案、检查执行结果,并将有用信息写入记忆。英伟达认为,正是这套包围模型的智能体运行框架,使系统能够在长流程中利用执行反馈不断修正策略。

这项成绩需要谨慎解读。ARC-AGI-3的25个公开环境属于所有开发者均可查看的示例,评测组织方明确将其与不可见的私有测试集区分开来;此前也已有其他研究系统在公开环境达到100%。因此,AVO证明的是它能够掌握已经发布的关卡,并不等同于在完整评测中获得满分,更不能据此宣称实现了通用智能。

不过,公开关卡仍是研究探索、记忆和错误恢复机制的受控环境。英伟达还称,AVO完成任务所需的环境操作少于一个对比系统,说明编排方式不仅影响能否成功,也可能影响效率。其泛化能力仍需通过独立复现和私有环境成绩检验。

为何重要

只比较底层模型,越来越难解释智能体产品的真实差距。记忆策略、工具选择、结果验证、状态追踪和重试机制,都可能让同一个模型呈现截然不同的任务表现。

AVO的结果进一步说明,行业投入正在向智能体框架和运行基础设施倾斜,尤其是需要长时间自主工作的场景。它也提醒评测发布者必须清楚说明成绩来自公开开发集还是隐藏测试集。对用户而言,关键问题已不只是哪个模型分数更高,而是哪套完整系统能以合理成本,在真正陌生的任务上稳定复现能力。

信源