Muse Glimmer 竞技场首秀成绩落在中游
Arena 首次给出人类偏好评分:Meta 新开源模型 Muse Glimmer 在 Code Arena WebDev 位列第 77、文本竞技场第 97,开源模型中分别排第 26 和第 24。
Meta 重回开放权重后的第一份外部成绩单
Arena 在北京时间周二凌晨放出 Muse Glimmer 的首份人类偏好评分,距 Meta 以 Apache 2.0 协议发布这个 300 亿参数模型仅一天。在 Code Arena 的 WebDev 榜上,该模型以 1359 分首发第 77 名,在开源模型中排第 26;在文本竞技场以 1426 分位列总榜第 97,开源模型中排第 24。
Muse Glimmer 是 Meta 一年多来最重要的开源动作,也是其战略重新转向开放权重的具体落点。它的定位是本地常驻的智能体工作,而不是刷聊天榜:约 300 亿参数,其中含 18 亿参数的视觉编码器,支持多模态输入,上下文超过 13.1 万 token,体量压到约 18GB,可在消费级硬件上通过 LM Studio 跑起来。Baseten 等托管商在首日就已上线。
这个定位让榜单成绩需要两面看。人类偏好类榜单奖励对话质感,且被体量大得多的前沿与准前沿模型占据,因此一个 300 亿参数的本地模型排在 70 名之外,本身并不能说明它在被设计去做的事上表现不佳——工具调用、函数结构遵循、多步任务完成,这些恰恰是这类榜单只能间接反映的能力。开发者的早期实测反馈中,它在智能体式代码探索上的口碑好于开放式创意生成。
为什么重要
但这毕竟是针对一次被 Meta 定义为「战略重置」的发布给出的首个外部数据点,而角度并不好看。在开源模型中排到第 24 至 26 名,意味着 Glimmer 首发时明显落在中国开放权重阵营之后——Kimi、GLM、千问以及 DeepSeek 衍生模型,正是这一年来在定义「前沿开源模型该是什么样」的那一批。Meta 为这次转向给出的理由是要在这条赛道上比它们跑得更好,而不是在最终必然被拿来对比的榜单上落后。
Arena 本周还另外提到,闭源与开源模型的性能差距已收窄至历史最窄。而这轮收窄并不是发生在 Glimmer 身上——对 Meta 来说,这才是更扎人的那句。