⚡ 猫叔的AI资讯雷达
AIGC开源模型

MiniMax 放出 H3 视频模型开源权重

MiniMax 正式开放全模态视频模型 H3 的权重下载,让一款榜单前列的视频生成模型首次可以在本地部署运行。

北京时间 8 月 3 日零点(UTC 8 月 2 日 16:00),MiniMax 放出全模态视频生成模型 H3 的模型权重,兑现了 7 月 31 日发布该模型时给出的开源承诺。权重首发于国内的魔搭 ModelScope,Hugging Face 镜像随后跟上;ComfyUI 同步上线了基于这批新公开权重的本地推理教程。

H3 在视频模型里的路子比较特别:它不是把文本、图像、视频、音频当成彼此独立的条件通道,而是放进同一个上下文里统一理解。模型可生成约 4 至 15 秒、最高 2K 分辨率、24 帧的片段,且原生双声道音频是在同一次生成里出来的,而非事后配音。在 Artificial Analysis 榜单上,H3 视频编辑排名第一、文生视频第二、图生视频第三——无论开源闭源,都属第一梯队。

公开的文件也让模型结构第一次看得清楚。ComfyUI 的本地工作流需要下载两个 int8 剪枝扩散权重(分别对应文生视频/图生视频与参考图驱动生成)、视频与音频两个 VAE,以及一个基于阿里 Qwen3-VL 32B 视觉语言模型改造的文本编码器。权重采用 MiniMax 社区许可证:非商用免费,年营收约 2000 万美元以下的机构商用亦免费,需标注来源。MiniMax 同时继续通过自家 API 与海螺 App 售卖托管服务,称 2K 每秒价格不到同类产品的三分之一。

为什么重要

此前视频生成的第一梯队几乎全部闭源:OpenAI Sora、谷歌 Veo、字节 Seedance 都只给 API。H3 打破了这条惯例——一款榜单前列的视频模型现在能跑在自己的机器上,工作室可以微调、可以拆看、也不必把素材交给厂商。它同时凸显出国内视频模型两条分岔的路线:同一周字节在扩大 Seedance 2.5 的闭源 API 覆盖,MiniMax 则直接把权重交了出去。对 ComfyUI 工作流、量化项目这类本地推理生态来说,终于有了一个真正有竞争力的底座模型。

信源