⚡ AI专注速报
AIGC模型

Black Forest Labs 推出 FLUX 3:首个视频模型原生带音频

FLUX 图像模型背后的德国实验室发布多模态旗舰 FLUX 3,单次生成 20 秒带原生音频的视频,并预告年内开源多模态底座。

做出 FLUX 图像模型的德国弗莱堡实验室 Black Forest Labs 发布了 FLUX 3——从这一代起,它不再只是一家图像公司。FLUX 3 被描述为在图像、视频、音频和动作预测上联合训练的单一多模态基础模型,首个落地产品是视频:单次生成最长 20 秒的片段,台词、脚步声、碰撞声等音频由同一个模型原生产出,而不是后挂一个音频模型。

能做什么

FLUX 3 Video 支持文生视频、图生视频、视频改写和关键帧过渡,可生成多语言对白。BFL 内部人类偏好测试(720p、10 秒片段)给出的胜率是:对 Luma Ray 3.2 达 93%,对 Runway Gen-4.5 为 77%,对可灵 v3 Pro 为 60%,对字节 Seedance 2.0 约打平。对比名单里明显缺席的是谷歌 Veo 和 OpenAI 的 Sora,且所有数字均为官方自测,尚无独立验证。

开放才是重头戏

目前通过封闭的 Early Access API 提供,权重私有,价格未公布;新版 FLUX 3 Image 数周内跟进。最值得关注的是:BFL 表示开放权重的多模态底座 FLUX 3 Dev 将于 2026 年晚些时候登陆 Hugging Face 和 GitHub。早期测试方包括 Canva、Krea、Magnific、Burda、Picsart。此外还有机器人分支 FLUX-mimic:与 mimic robotics 合作的视频-动作模型,已在奥迪生产实验室试用,官方称任务微调所需机器人数据从 30 多个小时压缩到约 30 分钟。

为什么重要:FLUX.1 的开放权重曾重塑图像生成生态。如果 BFL 兑现开放视频级多模态底座的承诺,同样的冲击可能降临视频生成——今天所有认真的视频模型玩家都是闭源的。音频原生、动作预测入训的设计也表明,BFL 把 FLUX 3 定位为早期世界模型,而不只是一个片段生成器。

信源