蚂蚁 Ling 3.0 Flash 重划开源效率前沿
第三方评测 Artificial Analysis 给蚂蚁 124B 开源模型打出 38 分,其约 5B 的激活参数量领先所有同档 flash 级模型。
第三方成绩
UTC 时间 7 日深夜,Artificial Analysis 公布了蚂蚁集团 Ling 3.0 Flash 的独立评测结果:在其 Intelligence Index v4.1.1 版本中得 38 分。该机构表示,这个总参数 1240 亿、每 token 激活约 50 亿参数的 MoE 模型,把开源模型在“智能水平 vs 激活参数量”上的帕累托前沿又向前推了一步,明显领先激活参数在 100 亿以上的同档 flash 级模型;在“智能水平 vs 总参数量”维度上,它同样位于前沿。
变化最剧烈的是幻觉表现。在惩罚“自信答错”而非单纯奖励答对的 AA-Omniscience 指标上,Ling 3.0 Flash 得 -18 分,相比上一代 Ling 2.6 Flash 的 -66 分提升了 48 分。Artificial Analysis 认为,这一进步主要来自幻觉率下降,而非知识覆盖面扩大。
模型情况
Ling 3.0 Flash 出自蚂蚁集团模型团队 inclusionAI,权重已于本月早些时候以 MIT 协议在 Hugging Face 与魔搭上线,提供 BF16(约 255GB)和 FP8(约 128GB)两个版本,可通过 SGLang、vLLM 部署。架构上采用原生混合线性注意力,以 5:1 的比例交替堆叠 KDA(Kimi Delta Attention)与 MLA 层,原生支持 256K 上下文并可扩展至 1M。蚂蚁此前称,该模型在其公布的多数基准上追平甚至超过自家万亿参数旗舰。
为何重要
决定推理成本的是激活参数量,而不是总参数规模。一个只用约 50 亿激活参数就能与体量大得多的开源模型打进同一档位的模型,会直接改变智能体大规模落地时的成本账——在这类场景里,用户的一次请求往往触发几十次模型调用。第三方复核比厂商自绘的图表更有说服力,而幻觉指标才是真正影响工程落地的部分:小激活量模型过去常以“多猜”换速度,而这恰恰是自动化流水线最受不了的。这一结果也再次说明中国团队的用力方向:在“单位智能成本”的前沿上竞争,而不是死磕榜单绝对分数。