⚡ AI专注速报
开源研究产业

阶跃星辰将 Attention-FFN 分离推理带入 vLLM 开源社区

阶跃星辰表示,正与 vLLM 团队、蚂蚁集团及 FastAFD 合作开源其注意力-FFN 分离(AFD)技术,把关键的 MoE 服务效率手段推向社区。

把模型拆开来服务得更快

阶跃星辰(StepFun)表示,正与 vLLM 项目、蚂蚁集团及 FastAFD 团队合作,将注意力-FFN 分离(AFD)带入开源社区。AFD 是一种推理技术,把大型 MoE 模型两个主导阶段分配到不同硬件池:受显存带宽约束的注意力阶段,与受算力约束的 FFN/专家阶段。由于单一同构部署无法同时为两者优化,拆分后各自可独立扩展,也让昂贵的加速器更少闲置。

这一路线由中国实验室率先在生产中落地——阶跃星辰、字节跳动、华为均在其列——并支撑了阶跃 Step-3 的效率。Step-3 是一款总参 321B、激活 38B 的 MoE 模型,将多矩阵分解注意力(MFA)与 AFD 协同设计。阶跃此前已开源用于 AFD 的通信库 StepMesh,其基于 vLLM 的实现在 H800 上、50ms 时延目标下,单卡解码吞吐据称可达约每秒 4000 tokens。

不断扩大的开源合力

此次合作与外部工作相互呼应,例如 UCSD Hao AI Lab 的 FastAFD——在 GB200 NVL72 上运行 Qwen3-235B 和 MiniMax-M2.5 时,其稳态单卡解码吞吐较调优后的同机部署 vLLM 基线高出 1.35–1.45 倍。这些努力合在一起,使 AFD 从各家私有的内部系统,走向最广泛使用的开源推理引擎中的共享能力。

为何重要

决定哪些模型能大规模落地的,越来越是服务成本而非单纯能力——业界对 token 效率的执念正说明了这一点。AFD 直接针对成本,从同样的 GPU 中榨出更高吞吐,对中国前沿实验室普遍采用的大型 MoE 架构尤为宝贵。把这一技术并入 vLLM,降低了任何团队高效运行大 MoE 模型的门槛,也强化了开源生态作为实用服务进展"共享而非独占"之地的角色。

信源