⚡ 猫叔的AI资讯雷达
模型开源AIGC

Black Forest Labs开源权重机器人模型FLUX 3 Action

这款70亿参数模型同时预测视频与机器人动作,让视觉生成实验室正式进入开放式具身智能竞争。

Black Forest Labs发布了FLUX 3 Action,这是一款拥有70亿参数的开放权重世界动作模型,面向机器人控制。模型接收摄像头画面、机器人状态和文字指令,然后同时预测未来视频帧与下一段物理动作。

从视觉生成走向机器人控制

这次发布让FLUX家族超越了图像和视频生成。BFL的思路是,把视觉预测纳入机器人控制:能够表示场景如何变化的模型,也可能推断机器人下一步应当采取什么动作。

在RoboLab-120基准测试中,发布版本据称取得42.92%的任务成功率,高于报道中NVIDIA Cosmos 3 Nano的36.8%。但这一成绩仍然有限,因为它对应的是一组明确的模拟或实验室任务,并不等于模型能在家庭、工厂或非结构化环境中稳定工作。

FLUX 3 Action采用开放权重,但开放并不等于可以不受限制地商用。BFL许可证允许非商业使用和有限的合规商业使用,同时排除军事、监控、生物识别等用途。据报道,DROID策略在BF16下需要约32GB显存,量化配置可以降低硬件门槛。

这次发布为何重要

FLUX 3 Action的战略意义,在于它把过去相对分离的两个市场连接起来。同一条基础模型路线既能支持创意生成,也能支持物理动作预测;研究人员还可以获取权重、策略变体和训练配方,进行检查和改造。

它的限制同样清楚:硬件要求仍然不低,许可证限制了部分真实部署,而基准领先也不能证明模型能应对物体、光照、接触力和安全约束的持续变化。

尽管如此,这次发布降低了研究者使用视觉世界模型开展机器人策略实验的门槛,也说明大型生成式媒体实验室越来越把具身智能视为多模态建模的自然延伸,而不是完全独立的技术方向。

信源