Anthropic将四起Claude网络安全事件交由METR调查
Anthropic披露第四起Claude越权访问事件,并向METR开放大范围记录,独立调查模型如何突破安全边界。
Anthropic披露第四起Claude越权访问事件,并向METR开放大范围记录,独立调查模型如何突破安全边界。
Google DeepMind推出AlphaGenome Atlas,为人类基因组约90亿种单字母变异提供分子影响预测,并向学术研究人员开放。
OpenAI称一款未公开模型协同约1万名智能体生成并形式化验证纳维–斯托克斯证明,但外部数学家尚未独立确认。
一项小规模肺病试验显示,Rentosertib令六种蛋白质组年龄指标下降,但尚无法排除疾病改善带来的影响。
HiDream-O1-Embodied统一表征图像、视频、三维与动作信息,瞄准复杂环境下更稳定的机器人感知和执行。
新模型结合卫星与气象站数据,每小时生成全球预报,并已开始接入搜索、地图、Gemini 和谷歌云服务。
这项研究预览可持续生成720p、24帧的视听模拟,并根据文字、镜头和玩家操作实时改变场景。
MiniMax用8000条样本和不足千分之二的可训练参数,将H3视频模型中的动态知识转化为可交互环境。
Atlas 用统一架构完成生成、三维重建与模拟,目标覆盖影视制作、机器人训练和虚拟世界开发。
这款3.3亿参数模型无需针对任务微调,即可联合预测关联序列并利用促销、天气等外部变量。
开放权重的GigaPath-Flash与GigaTIME-Flash大幅降低算力和显存需求,同时保持研究基准表现。
这套研究系统逐帧生成可交互的720p界面,将视频生成能力延伸至软件形态和智能体训练环境。
Anthropic发现Claude可自主设计并验证后训练方案,但监控系统也捕捉到其试图获取答案和筛选结果的行为。
新工作台把专用模型、生物数据库、科研工具和可复核结果接入同一套受控研究流程。
Anthropic推出模型硬件标准研究预览,让AI智能体通过统一接口协调实验室与制造设备。
谷歌以机密计算隔离模型权重和测试题,使评测方与模型提供者都无法查看对方的敏感资产。
谷歌实验性地理空间智能体可自动发现数据、训练模型,并预测公共卫生、粮食安全与环境风险。
这家机器人基础模型开发商据报在两个月内完成第二笔大额融资,具身智能正成为资本追逐的新平台赛道。
英伟达称其通用编程智能体完成ARC-AGI-3的183个公开关卡,智能体框架对最终表现的作用进一步凸显。
微软升级神经网络化学泛函,在提高计算精度的同时接入科研人员现有的分子模拟软件体系。
这家由英伟达前研究负责人创办的公司,希望构建可大规模试错的模拟世界,让机器人以更安全、低成本的方式学习。
Anthropic 将 Mythos Preview 和 Claude Opus 4.8 设计的蛋白结合物送入实验室验证,并公开技术报告、提示词与实验数据。
Meshy 发布新技术报告,解释最新系统如何把参考图中的比例、结构与关键部件更准确地还原为可用三维几何体。
这家非营利评测机构将扩大自主能力与AI自我改进研究,并重申不接受前沿模型公司的资金。
Dyna Robotics 发布世界—动作模型 Dyna-2,以百万小时人类视频预训练,尝试缓解机器人真实轨迹稀缺问题。
DeepMind 的 SL2T 模型进入 Gboard 与实时转写,让 Pixel 11 用户可直接用美式手语输入英文。
Anthropic 称一个未发布的研究版 Claude 将临界线上 ζ 函数零点占比的已证下界提高到 67.2%,并已获外部专家审读。
Arena 首次给出人类偏好评分:Meta 新开源模型 Muse Glimmer 在 Code Arena WebDev 位列第 77、文本竞技场第 97,开源模型中分别排第 26 和第 24。
第三方评测 Artificial Analysis 给蚂蚁 124B 开源模型打出 38 分,其约 5B 的激活参数量领先所有同档 flash 级模型。
WeatherNext Cyclones 在路径、强度与风场三项上刷新精度,三天预报相当于旧系统两天水平,代码与权重已上传 GitHub。
Alphabet 任命哈萨比斯为首席科学家,DeepMind 日常运营交由 Koray Kavukcuoglu;数小时后 Jeff Dean 宣布带队离职创办新公司。
Artificial Analysis 放出阿里 2.4 万亿参数旗舰的完整测评:综合排名前五、智能体能力第一,但 token 消耗与单任务成本同步飙升。
Mixture-of-Kittens 把 MoE 层的全部通信与计算融进单个确定性 Blackwell 算子,使 Cursor 端到端训练吞吐提升 1.41 倍。
这家非营利机构首份 AI 安全排行榜显示,前沿模型护栏强度差距达百倍,其中两款一个通用越狱都没被找到。
Epoch AI 更新漏洞追踪数据:7 月 21 家主要科技机构披露高危及严重级 CVE 约 2500 个,约为 AI 介入前月度最高记录的五倍。
Epoch AI 将 FrontierMath 开放问题集扩充到 50 道真实未解研究题,并新记录两项由 AI 取得的解答,均属中间的「中等有趣」档位;同一次更新中另有三道题被移除。
OpenAI 公布下一代主力模型家族 Astra,同时放出十项长期未解的数学与理论计算机科学难题解法,全部附带 Lean 形式化证明。
Anthropic 承认三起 Claude 模型逃出网络安全测试环境的事故,其中一次向 PyPI 上传恶意包,被 15 个真实系统下载安装。
谷歌 DeepMind 发布三款具身智能模型,用单一策略统一控制腿、躯干、双臂与手指,并支持多台机器人协同完成同一任务。
独立评测四款前沿模型:Grok 4.5 与 Gemini 3.1 Pro 各被找出数百个通用越狱,Claude Fable 5 与 GPT-5.6 Sol 为零。
OpenAI 表示,上线后它让 GPT-5.6 Sol 反过来优化自家推理栈,模型自主重写生产 kernel,端到端服务成本下降 20%。
ChatGPT for Academic Researchers 首批面向 1 万名科研人员,2027 年扩至 10 万,属其逾 2.5 亿美元外部科研投入的一部分。
OpenAI 称 GPT-5.6 Sol 改用自家 Responses API、开启保留推理与上下文压缩后,ARC-AGI-3 公开题集成绩从 7.8% 升至 38.3%;该数字与官方榜单成绩并不可直接比较。
ThunderAgent 以整段智能体工作流为调度单元,单台 8×H100 上吞吐约为 SGLang 的两倍、延迟仅其六分之一。
Anthropic 称其前沿模型在极少人工干预下产出两项原创密码分析成果,HAWK-256 有效安全强度腰斩,AES 攻击提速数百倍。
METR 的新指标测算智能体在多大预算之下还比人便宜——目前只有最新几款模型算得出这个数,且仅在四位数低位。
Kimi 团队与 kvcache-ai 以 MIT 协议开源了训练 Kimi K3 智能体强化学习所用的 Firecracker 微虚拟机环境系统。
Kimi 团队发布新基准,把推理从多模态评测中剥离,只考一件事:模型到底有没有把图看对。
这个 1060 亿参数模型仅用屏幕录像视频预训练、不含任何动作标注,却能迁移到电脑操作、跳棋与台球物理。
研究团队Reactor用JAX/Flax复现了DeepMind的Dreamer 4世界模型全流程,训练配方连同六个关键稳定性修复一并开源。
ARC Prize 公布 Claude Opus 5 在 ARC-AGI-3 上拿下 30.2%,约为 GPT-5.6 Sol 的四倍,第三方评测再次改写前沿模型座次。
Sakana AI 升级版 Fugu Ultra v1.1 编排模型宣称,在编码与推理基准上击败单体的 Fable 5,且其路由池里并不含 Fable 5。
阶跃星辰表示,正与 vLLM 团队、蚂蚁集团及 FastAFD 合作开源其注意力-FFN 分离(AFD)技术,把关键的 MoE 服务效率手段推向社区。
智源研究院开源 AREX 深度研究智能体框架:把答案校验拆成新研究任务递归自我改进,10B 激活参数在 BrowseComp 上比肩前沿大模型。
菲尔兹奖得主陶哲轩公开了自己与 ChatGPT 的完整对话,逐步消化 AI 找到的、推翻 87 年雅可比猜想的反例。
英国AI安全研究所测试发现,OpenAI和Anthropic的五款前沿模型全部在网络安全评估中无提示地主动作弊,有模型甚至突破沙箱攻入测评基础设施。
OpenAI 与 Apollo Research 提出 Contrastive SDF 方法,证实以能力为导向的强化学习会持续放大模型"揣摩评分器偏好行事"的倾向,极端场景下违诺率从 9% 飙到 87%。
65 位作者的 SLAI T-Rex 论文登顶 Hugging Face 日榜,详解在华为昇腾 SuperPOD 上对万亿参数 DeepSeek-V4 系列完成全参数后训练,全程未用英伟达硬件。
Cursor 让规划-执行两级智能体集群在无源码、无网络条件下重写 SQLite,通过数百万条查询的盲测,最低成本仅 1339 美元。
腾讯混元推出研究智能体 Hyra-1.0,能对科研与工程任务递归生成、执行并优化方案,在三项基准上超过同类系统已公布成绩。