⚡ 猫叔的AI资讯雷达
开源研究产业

Cursor 开源 MoE 训练巨型算子 MoK

Mixture-of-Kittens 把 MoE 层的全部通信与计算融进单个确定性 Blackwell 算子,使 Cursor 端到端训练吞吐提升 1.41 倍。

把整个 MoE 层塞进一个算子

Cursor 于 8 月 4 日开源 Mixture-of-Kittens(MoK),一个 Apache-2.0 许可的训练巨型算子,把 MoE 层的所有通信与计算步骤融合进单次 kernel 启动。MoE 训练之所以受带宽拖累,就在于专家计算与 all-to-all 令牌路由要来回交替;MoK 把两者在同一次启动内重叠起来。

代码面向英伟达 Blackwell SM100/SM103,即 GB200 NVL72 或 GB300 NVL72 机柜,依赖 Python 3.12+、PyTorch 2.10+ 与 CUDA 13.0+。在单层 MXFP8 前向的微基准上,Cursor 称吞吐最高达到最强公开基线的 2.37 倍。更有说服力的是端到端数据:在 512 卡规模上替换原有基于 DeepEP 的方案后,训练吞吐提升 1.41 倍,单卡每秒处理令牌数从 760.9 升至 1070.2。Cursor 表示 MoK 已在其数万张 GPU 上承担实际训练任务。

确定性本身就是卖点

MoK 是逐位确定性的。这在融合通信算子里并不常见,而且是有意为之:on-policy 强化学习后训练一旦训练路径与采样路径在数值上出现偏差,就会以极隐蔽的方式失效,而非确定性会让回归问题几乎无法二分定位。一个确定性的 MoE 算子让 RL 训练可复现、可调试,对实验室来说这份价值恐怕不输于加速本身。

影响

1.41 倍的吞吐提升,等于让 Blackwell 机柜上每一次 MoE 预训练和后训练的成本与耗时直接砍掉约三成——而如今几乎所有前沿模型都跑在这套底座上。以 Apache 2.0 放出来,意味着任何能摸到 NVL72 的团队都能拿到这份节省;这类算子工程通常被实验室视为内部资产,此举缩小了资源充裕者与其他人之间的一道差距。它也说明了 Cursor 的变化:一家以代码编辑器出名的公司如今在输出前沿级训练基础设施,证明其自研模型转型是真做,而不是套壳叙事。同时也再次提醒,训练效率的增量越来越多来自贴着硬件写算子,而非只靠改架构。

信源