DeepSeek发布V4.1 Flash,主打百万Token长上下文
DeepSeek推出V4.1 Flash,支持原生多模态和百万Token上下文,并通过缓存优化大幅降低长上下文推理成本。
DeepSeek已通过API发布V4.1 Flash,重点解决长上下文推理中的显存、存储和服务成本问题。官方介绍称,该模型采用5520亿参数混合专家骨干网络,并引入因果编码器—解码器架构;输入阶段约激活80亿参数,解码阶段约激活160亿参数。
长上下文成本成为主战场
V4.1 Flash延续了DeepSeek以效率换规模的路线。官方称,新模型的KV缓存需求较上一代大幅下降,HBM占用降至四分之一,SSD存储需求降至八分之一。模型支持百万Token上下文,并通过API提供原生多模态能力。
价格也同步下调。DeepSeek公布的空闲时段价格为:缓存命中输入每百万Token 0.02元,未命中输入1元,输出4元;高峰时段价格翻倍。公司还表示,将与开源社区合作推进V4.1 Flash的推理支持,并探索更多部署方式。
Flash取代Pro成为当前主力
这次发布不仅是一次模型升级,也重排了DeepSeek的产品线。V4 Flash和V4 Flash Vision Experimental将退出服务;9月14日之后,在下一代Pro模型发布前,面向V4 Pro的请求将被路由至V4.1 Flash,并按Flash价格计费。DeepSeek称,内部和外部测试显示,V4.1 Flash在性能、价格、速度和总耗时上均超过V4 Pro,但这些对比尚未经过独立机构复核。
为什么值得关注
这条消息的核心价值,在于它直接瞄准了实际部署中最昂贵的环节:持续处理超长上下文。如果缓存占用的下降能够在第三方环境中复现,文档分析、代码助手和智能体系统有望减少显存与存储投入。尚未确定的是,这些效率是否同样适用于DeepSeek自有服务栈之外的部署和工作负载。