⚡ AI专注速报
产业模型开源

国产算力 Day0 跑通 2.8 万亿参数 Kimi K3

阿里云称真武 M890 超节点是国内首个成功运行月之暗面 2.8 万亿参数模型的超节点,华为昇腾同日宣布零日适配。

为万亿参数推理准备的超节点

阿里云 7 月 28 日宣布,灵骏真武 M890 超节点实例已完成对 Kimi K3 的 Day0 适配。K3 是月之暗面 7 月 27 日开源的 2.8 万亿参数模型,阿里云称这是国内首个成功跑通近 3 万亿参数模型的超节点。

该实例由 64 张阿里自研平头哥真武 M890 加速卡组成,通过自研 ICN Switch 高速互联芯片实现 800GB/s 全互联,单节点显存池规模达 9TB。对 K3 这种体量的模型来说,显存是硬约束:没有这一级别的显存池化,权重只能摊到大量松耦合节点上,跨节点通信会主导整体时延。

阿里云、平头哥与 Kimi 团队从软件栈、算子层面做了联合深度适配。阿里云给出的数据是:首 Token 时延降低约 35%,单卡解码吞吐提升 1.8 倍。此外,千问 AI 平台与阿里云百炼也将提供 Kimi K3 的模型 API——考虑到月之暗面与阿里自家通义千问是直接竞争关系,这一点值得留意。

华为同日给出对应表态。华为计算称昇腾在 K3 开源当天即完成零日适配:训练侧在 Atlas 800 A3 与 Atlas 900 A3 SuperPoD 上完成训练复现,配合算子、并行加速与显存优化;推理侧通过开源引擎 vLLM Ascend 和 SGLang 部署。华为还提到昇腾 950 超节点支持 FP8、MXFP8、MXFP4 精度格式,可原生承接月之暗面发布的 mxFP4 量化权重。

为何重要

这条消息的分量不在性能数字,而在于闭环终于合上。此前中国最大的开源模型,训练与服务环节仍以英伟达芯片为主,意味着最有代表性的成果依然依赖受出口管制的硬件。如今两家国产厂商在旗舰级模型发布当天就完成适配——其中一家还是竞争对手实验室的云业务——说明历来比算力本身更难补的软件栈成熟度差距正在收窄。对国内企业而言,采购 K3 级别模型的算力方案,从此可以不必绕道华盛顿的许可体系。

信源