⚡ AI专注速报
研究模型

登顶 Hugging Face 日榜:DeepSeek-V4 全参数后训练跑通华为昇腾超节点

65 位作者的 SLAI T-Rex 论文登顶 Hugging Face 日榜,详解在华为昇腾 SuperPOD 上对万亿参数 DeepSeek-V4 系列完成全参数后训练,全程未用英伟达硬件。

一篇题为《SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD》的论文 7 月 22 日提交 arXiv,次日便登顶 Hugging Face 每日论文榜。这篇由 65 位作者署名的工作,把 AI 基础设施圈盯了很久的一件事写成了公开技术报告:在华为昇腾 NPU SuperPOD(超节点)上、完全脱离英伟达 GPU,对 DeepSeek-V4 系列前沿模型完成全参数后训练——该系列最大版本约 1.6 万亿参数。据 Tom's Hardware 报道,训练集群规模约为 1000 张昇腾 910C。

啃下最难啃的三块骨头

万亿参数 MoE 模型的全参数后训练,恰好压在非英伟达技术栈历来最薄弱的环节上:显存压力、无法与计算重叠的通信开销、以及低效的算子执行。团队给出的方案是一套分层优化框架,贯穿模型并行策略、计算-通信编排和底层 kernel 执行三个层面。最终结果是在保持训练稳定的前提下达到 34.22% 的 MFU(模型算力利用率),较开源基线方案提升 2.93 倍。

系统工作之外,论文还附带了一个领域落地案例:通过继续预训练加上覆盖四类运筹学任务的 1 万条高质量 SFT 数据,团队把 DeepSeek-V4-Flash 特化为求解器结合的推理模型,零样本 Pass@1 达到 71.81%,比基座模型高 11.27 个百分点,按其测算也比 GPT-5.4-Mini 高 3.98 个百分点。

为什么重要

昇腾芯片跑推理在国内已是常态,真正难的是前沿规模的训练,而这篇论文是迄今最详尽的公开记录之一。如果万亿参数 MoE 模型能在国产芯片上以有竞争力的效率完成后训练,那么美国出口管制在"把强基座模型调教成可部署的专用模型"这一环节——也是当下应用 AI 的主战场——的约束力就会明显打折。论文迅速登顶 Hugging Face 日榜,说明研究社区也读出了同样的信号:去英伟达化的训练栈,成熟速度超出了怀疑者的预期。

信源