阿里发布 Qwen3.8-Omni-Flash,支持百万 Token 上下文
阿里新模型原生处理文本、图像、音频和视频,并结合工具调用,面向长上下文多模态 Agent 工作流。
一个模型处理长程多媒体任务
阿里 Qwen 团队于 9 月 18 日发布 Qwen3.8-Omni-Flash。这款原生全模态模型可在同一系统中接收文本、图像、音频和视频输入,并支持最高 100 万 Token 的上下文窗口,目前已通过千问平台和云服务提供。
根据 Qwen 官方模型文档,该模型构建于 Qwen3.8-Flash-Next 架构之上,目标不是单纯理解媒体内容,而是服务于具备执行能力的生产力场景。适用方向包括编程、知识工作、图形界面交互、视频剪辑、音乐视频制作、影视流程、旁白、多媒体摘要以及音视频对话。它还支持双声道和四声道空间音频理解,并兼容 DashScope 与 OpenAI 协议。
Qwen 将这次发布定义为感知、推理和工具调用的整合。其意义在于,当前不少多媒体系统仍把转录、视觉分析、规划和执行拆分给多个组件。一个模型如果能够检查长视频、定位关键片段、同时理解语音与画面、进行推理并调用工具,就可能降低制作流程中的编排成本。
为什么重要
这次发布强化了中国模型厂商在实用多模态 Agent 领域的竞争力。百万 Token 上下文很醒目,但更困难的问题是:模型能否在长视频、嘈杂音频和多轮工具调用中持续保持稳定。Qwen 最终的竞争优势,将取决于生产环境中的可靠性和价格,而不是上下文数字本身。