⚡ AI专注速报
开源研究

Open Dreamer开源复现Dreamer 4世界模型,完整训练配方公开

研究团队Reactor用JAX/Flax复现了DeepMind的Dreamer 4世界模型全流程,训练配方连同六个关键稳定性修复一并开源。

一个名为Reactor的研究团队发布了Open Dreamer——DeepMind世界模型Dreamer 4训练管线的开源JAX/Flax复现。Dreamer 4的成名之处,是让智能体完全在自己学到的游戏模型内部训练,最终学会了在Minecraft里挖钻石;但原论文并未附带完整可用的公开实现。Open Dreamer这次把整套训练栈都放了出来:因果视频tokenizer、动作条件的隐空间动力学模型、带配置细节的完整训练配方、本地推理框架,外加一个浏览器里实时生成画面的Minecraft演示。

放出了什么,没放什么

复现的核心是一个16亿参数的动力学Transformer(30层,模型宽度1920),用Muon优化器训练20万步,单卡256帧、约24GB模型状态,在NVIDIA B200上报告了57%–58%的模型算力利用率。需要注意的是,预训练权重以及行为克隆、强化学习两个阶段并未包含——这是世界模型的骨干,不是开箱即用的智能体。

瓶颈不是吞吐,是稳定性

这次发布最有价值的部分可能是工程笔记。团队直言真正的瓶颈不是训练速度而是稳定性,并记录了六个关键修复,针对的是一种论文里很少写的失败模式:loss曲线一路向好,生成质量却在悄悄劣化。loss与出片质量脱钩是世界模型训练的著名陷阱,而一份写清楚怎么绕开它的配方,此前几乎找不到。

这次开源正好落在世界模型的行业热潮当中——Genie、Cosmos、Marble等前沿工作几乎全部闭源或只部分开放。带着诚实失败记录的独立复现,对世界模型的意义就像当年的开源复现之于LLM训练:把少数实验室的隐性知识变成公共基础设施。对没有DeepMind级资源的研究者来说,一份验证过、能稳定训练的配方,比又一张benchmark榜单值钱得多。

信源