⚡ AI专注速报
研究开源模型

月之暗面开源 PerceptionBench:无模型突破 60%

Kimi 团队发布新基准,把推理从多模态评测中剥离,只考一件事:模型到底有没有把图看对。

考的是「看见」,不是「想通」

月之暗面发布了 PerceptionBench,一套把视觉感知从其上层推理中剥离出来单独评测的基准。Kimi 团队在 7 月 27 日晚宣布该基准开源,并称其能力项不是自上而下拍出来的分类,而是从当前多模态模型的真实失败模式中归纳出的一组「原子能力」。

基准包含约 3000 道题,覆盖计数、OCR、空间定位、深度判断、细粒度识别等十项能力。核心设计约束是:每道题都必须仅凭「看」就能作答——不依赖外部知识、不需要多步推理链、不做图像本身之外的计算。这个约束是刻意的。现有多模态基准大多把感知、知识与推理揉在一起,模型可能在看错像素的情况下靠推理猜对答案,也可能看得没错却因为后续推理崩掉而失分。这两种情况都无法告诉开发者问题究竟出在哪一层。

最引人注意的结果是:所有受测模型准确率均未突破 60%。月之暗面刚刚开源权重的 2.8 万亿参数旗舰 Kimi K3 以约 58.5% 居首,略高于第二名的约 57.2%。PerceptionBench 本身列在 K3 技术材料所报告的自研评测之中,因此这一排名带有「自家实验室发布自家夺冠的基准」这一惯常的保留意见。

本周月之暗面同期还开源了一批基础设施,其中包括支撑 K3 智能体强化学习训练的分布式沙箱系统 AgentENV。

为何重要

多模态分数一路走高,但一线开发者反馈的却是些不起眼却顽固的错误:数错物体个数、编造表格单元、把图表坐标轴看反。PerceptionBench 提供了一把能把这类错误与推理错误分开的诊断工具,而全场不足 60% 的成绩说明,感知层的瓶颈比综合榜单呈现的要严重得多。对文档理解、GUI 智能体这类系统来说,一个字段读错会沿着后续每一步放大,这种区分具有直接的工程意义。悬而未决的是采纳问题:由前沿实验室自己出题的基准,需要独立复现之后,业界才会把它当作中立标尺。

信源