DeepSeek 开源昇腾算子,补强国产推理软件栈
DeepSeek 面向华为昇腾 950 开源稀疏注意力算子,显示国产 AI 硬件能否竞争,关键也在软件优化。
软件成为关键战略层
DeepSeek 面向华为昇腾平台开源了一批推理基础组件,包括针对昇腾 950 NPU 优化的稀疏注意力 Prefill 和 Decoding 算子。相关代码已进入 FlashMLA 仓库,目标是让 DeepSeek V4.1 能够更高效地运行在 NVIDIA CUDA 生态之外。
DeepSeek 给出的数据显示,这些昇腾算子在 Prefill 阶段最高达到 410 万亿次浮点运算,相当于硬件理论峰值的约 95%;在 Decoding 阶段达到 360 万亿次,相当于约 83%。项目还包含融合算子,并称其中一条解码路径的性能提升约为 10% 至 15%。
这些数字目前仍属于厂商披露,尚未经过独立的系统级评测,而且存在明确限制。新版移除了对 NVIDIA Hopper 和部分旧版 DeepSeek 模型的支持,并修改 FP8、FP4 KV Cache 格式;在昇腾平台运行还需要特定版本的 CANN 和 torch_npu 软件环境。
为什么重要
这次发布的意义不止于一个代码仓库。高端 AI 硬件只有在软件栈能充分释放芯片性能时才真正有用。通过公开优化后的算子,DeepSeek 正在降低模型部署到华为硬件上的工程门槛,也让昇腾成为研究者和基础设施团队更可信的目标平台。
它还显示,中国头部模型公司与国产加速器生态正在进一步靠拢。这并不能证明昇腾已在所有工作负载、开发工具和全球供货能力上追平 NVIDIA,但它削弱了“换芯片就能解决问题”的简单判断:持续的软件优化,确实可能改变替代平台的部署经济性。