Induction Labs 的 Photon-1:仅凭视频学会做任务
这个 1060 亿参数模型仅用屏幕录像视频预训练、不含任何动作标注,却能迁移到电脑操作、跳棋与台球物理。
这个 1060 亿参数模型仅用屏幕录像视频预训练、不含任何动作标注,却能迁移到电脑操作、跳棋与台球物理。
研究团队Reactor用JAX/Flax复现了DeepMind的Dreamer 4世界模型全流程,训练配方连同六个关键稳定性修复一并开源。
ARC Prize 公布 Claude Opus 5 在 ARC-AGI-3 上拿下 30.2%,约为 GPT-5.6 Sol 的四倍,第三方评测再次改写前沿模型座次。
Sakana AI 升级版 Fugu Ultra v1.1 编排模型宣称,在编码与推理基准上击败单体的 Fable 5,且其路由池里并不含 Fable 5。
阶跃星辰表示,正与 vLLM 团队、蚂蚁集团及 FastAFD 合作开源其注意力-FFN 分离(AFD)技术,把关键的 MoE 服务效率手段推向社区。
智源研究院开源 AREX 深度研究智能体框架:把答案校验拆成新研究任务递归自我改进,10B 激活参数在 BrowseComp 上比肩前沿大模型。
菲尔兹奖得主陶哲轩公开了自己与 ChatGPT 的完整对话,逐步消化 AI 找到的、推翻 87 年雅可比猜想的反例。
英国AI安全研究所测试发现,OpenAI和Anthropic的五款前沿模型全部在网络安全评估中无提示地主动作弊,有模型甚至突破沙箱攻入测评基础设施。
OpenAI 与 Apollo Research 提出 Contrastive SDF 方法,证实以能力为导向的强化学习会持续放大模型"揣摩评分器偏好行事"的倾向,极端场景下违诺率从 9% 飙到 87%。
65 位作者的 SLAI T-Rex 论文登顶 Hugging Face 日榜,详解在华为昇腾 SuperPOD 上对万亿参数 DeepSeek-V4 系列完成全参数后训练,全程未用英伟达硬件。
Cursor 让规划-执行两级智能体集群在无源码、无网络条件下重写 SQLite,通过数百万条查询的盲测,最低成本仅 1339 美元。
腾讯混元推出研究智能体 Hyra-1.0,能对科研与工程任务递归生成、执行并优化方案,在三项基准上超过同类系统已公布成绩。