Sand.ai 开源 MAGI-2:1140 亿参数 MoE 视频模型
国内视频大模型公司 Sand.ai 放出 MAGI-2-preview 权重与推理代码,1140 亿参数稀疏架构、Apache 2.0 协议,可生成带同步音轨的 1080P 视频。
8 月 5 日,视频生成公司 Sand.ai(三呆科技)开源了 MAGI-2-preview 的预训练权重与推理代码。这是一个总参数 1140 亿、每 token 仅激活约 60 亿参数的混合专家(MoE)视频生成模型,可生成 10 秒长、音画由同一模型联合产出的片段。
放出了什么
模型卡显示,MAGI-2 采用单流 Transformer 架构,基于自研的 MagiMoE 设计:每层配置数千个专家单元,配合多头专家路由。这实际上是把重塑了大语言模型的稀疏扩展路线搬进视频生成——而当下几乎所有前沿视频模型仍是稠密结构。音频与视频共享同一套注意力层,而非外接语音或音效模型,官方称这是口型、音效与环境声能够精确对齐的原因。
推理走两段式流程:先低分辨率预览,再由 refiner 放大到 1088×1920,目前只支持 10 秒定长。公开的权重合计约 300GB,包含 Transformer 两阶段、Qwen3.5-27B 文本编码器以及视频与音频 VAE,参考实现需要 8 张 NVIDIA Hopper 架构 GPU,并提供了 Docker 镜像。代码与权重均为 Apache 2.0 协议。量子位测算,8 卡 H100 生成一条 10 秒 1080P 视频的成本约合 5 毛美元;尽管激活参数极小,该预览版在 Artificial Analysis 视频生成榜上位列第六。
为什么重要
国内实验室开源视频权重已成常态,但此前几乎都是几十亿到百亿级别的稠密模型——视频生成受显存带宽制约,MoE 路由在这一场景下并不好做。Sand.ai 想证明的是稀疏化可以迁移:一个具备千亿级知识容量的模型,可以按 60 亿参数量级的算力成本跑起来。若社区复现能站住脚,开源视频生成的成本曲线将像文本侧那样被重写。而这距离 MiniMax 开源 H3 视频模型仅数天,「可自由下载的最强视频模型出自中国团队」这一格局正被进一步固化。