⚡ 猫叔的AI资讯雷达
模型产业

DeepSeek V4-Flash 重训上线,智能体能力大涨

DeepSeek 于 7 月 31 日开放重新后训练的 V4-Flash 正式 API 公测,第三方测评智能指数升至 50 分,价格维持 0.14/0.28 美元不变。

只换后训练,不换架构

7月31日,DeepSeek 正式开放 DeepSeek-V4-Flash API 公测,并在更新日志与 X 上说明:这次上线的是对预览版重新做过后训练的版本,而非全新模型。官方强调模型架构与参数规模与预览版完全一致,接口现已原生支持 Responses API 格式,且此次升级只作用于 deepseek-v4-flash——V4-Pro API 以及 App、网页端所用模型均未改动。

DeepSeek 自报的提升集中在智能体能力:Terminal Bench 2.1 得分 82.7,Cybergym 76.7,Toolathlon(verified)70.3,DSBench-FullStack 68.7,NL2Repo 54.2,Agent Last Exam 25.2。

第三方评测印证了这次跃升

数小时后,Artificial Analysis 给出独立测评:智能指数从 4 月版 V4-Flash 的 40 提升到 50,一次跳了 10 分,比 DeepSeek 自家更大的 V4-Pro 还高 6 分,仅落后最高推理档的 GPT-5.6 Luna 1 分。在面向真实工作任务的 GDPval-AA v2 智能体评测上,Elo 从 1189 升至 1559。对幻觉更敏感的 AA-Omniscience 指数也从 -23 改善到 -16,评测方认为这完全来自幻觉率下降,而非知识面扩大。

关键在于价格没变:缓存未命中每百万输入 token 0.14 美元、命中 0.0028 美元,输出每百万 token 0.28 美元。这让新版本在“智能—单任务成本”曲线上几乎垂直地压在旧版之上。

为什么值得关注

以美国头部模型约五十分之一的价格拿到接近前沿的分数,会加剧本周由 GPT-5.6 降价掀起的挤压。对搭建智能体流水线的买方来说,取舍已经不是“智能还是便宜”,而是哪一个便宜模型能在长链工具调用中不跑偏——DeepSeek 现在证明了,仅靠一轮后训练、在同样的算力预算下就能补上大半差距。这也说明中国团队接下来比的不是榜单名次,而是每完成一个任务的成本。

信源