Cohere 开放 24 亿参数视觉模型,瞄准端侧部署
North Micro Vision 以 24 亿参数承载文档和视觉理解能力,开放权重并采用 Apache 2.0 许可证。
可定制的小型视觉模型
Cohere 发布视觉语言模型 North Micro Vision,参数量为 24 亿,面向端侧部署和专业视觉应用。模型权重已在 Hugging Face 开放,并采用 Apache 2.0 许可证,允许商业使用、修改和再分发,用户不必依赖 Cohere 的托管服务。
该模型重点处理结构化信息提取、视觉问答,以及文档、图表和科学图像理解。Cohere 公布的对比结果显示,它在部分视觉基准上超过了体量相近的 Gemma 4 E2B 和 Ministral 3 3B。不过,厂商选择的评测仍需独立验证,尤其要观察模型在真实业务中的图片类型、语言和复杂版式上能否保持表现。
24 亿参数的体量是这次发布的核心。North Micro Vision 可以面向苹果设备和中小型 GPU 环境,而不是只能运行在数据中心集群。发布当天,社区已提供苹果 MLX 框架支持;Axolotl 和英伟达工具链则覆盖微调与部署。Cohere 也明确把它定位为可进一步训练的视觉底座,例如针对某一种固定表单提取字段,或专门理解某类技术图纸。
为何重要
许多高价值视觉任务并不需要一个什么问题都能回答的通用助手,而是需要可控、低成本、靠近数据运行,并能适配固定格式的模型。对于处理敏感企业文档的场景,一款采用宽松许可证的小模型,实际部署价值可能高于大型系统在基准上取得的有限提升。North Micro Vision 也延续了开放模型领域的一条重要趋势:过去只能通过云端多模态 API 获得的能力,正在被拆分为设备厂商和软件公司可以自行拥有、微调和运营的小型组件。