⚡ 猫叔的AI资讯雷达
模型Agent

DeepSeek 为 V4 Flash 实验版接入视觉能力

DeepSeek 推出多模态实验接口,将图像理解、可复用文件上传与智能体框架支持纳入 V4 Flash 产品线。

V4 Flash 补上视觉输入

DeepSeek 推出实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,并已在其 API 平台开放调用。该接口可同时接收图片和文字;DeepSeek 称,其文本能力与 DeepSeek-V4-Flash 基本持平。开发者只需指定 deepseek-v4-flash-vision-exp 即可使用,但此次上线没有同步提供可下载权重,也不代表模型已经进入正式生产阶段。

图片会被转换为计费令牌,沿用 V4-Flash 的价格,每张图最多计入 384 个令牌。较低的令牌上限有望降低截图、文档、图表和照片理解等任务的使用成本。不过,DeepSeek 尚未公布完整评测,图片分辨率和任务复杂度如何影响识别准确率,仍需开发者实际验证。

文件可成为智能体的长期输入

与新模型一同上线的还有 Files API。开发者上传一次图片后即可获得 file_id,后续请求可以直接引用,不必反复传输原始文件。DeepSeek 表示,这项文件功能目前免费。对于需要多轮查看同一张流程图、界面截图或参考图的智能体,这种方式可以节省带宽,也能简化应用逻辑。

官方演示还显示,该模型能够接入智能体框架并配合工具调用。它的价值因而不只在于回答图片相关问题:智能体可以先观察视觉状态,再判断下一步动作并调用工具,无需在独立的语言模型与视觉模型之间来回切换。

为何重要

原生图片输入补齐了 DeepSeek 现有 API 产品线的一项关键能力,也让价格较低的 Flash 型号更适合文档自动化、界面测试和视觉智能体。不过,“实验版”仍是重要限制:在开放权重、完整基准和生产稳定性承诺公布之前,这次更新更适合被视为面向开发者的试用,而非一款新的开放多模态基础模型。

信源