⚡ 猫叔的AI资讯雷达
模型开源AIGC

Google发布可端侧运行的多模态EmbeddingGemma 2

Google发布开放的7.4亿参数多模态嵌入模型,可将文本、代码、图像、音频和视频映射到同一空间。

Google DeepMind发布EmbeddingGemma 2,这是一款面向消费级设备的开放多模态嵌入模型,目标是支持本地搜索、路由和检索。模型拥有7.4亿参数,可将文本、代码、图像、音频和视频表示在同一个嵌入空间中,让应用跨不同媒体类型进行检索。

Google称,模型支持最长8000个token的输入,以及最长5.5分钟的音频或视频记录。模型已通过Hugging Face、Kaggle和Google AI Edge提供,整体设计面向本地或边缘部署。它采用模块化方案,开发者可以使用完整模型,也可以根据任务选择视觉或音频编码器。

它真正要解决的不是聊天,而是应用背后的检索层。用户可以用文字搜索图片,用语音备忘录定位视频中的某个片段,也可以构建跨企业混合文件的检索增强生成系统,而不必把所有素材都上传到云端。Google还称,EmbeddingGemma 2在部分任务上能与体积更大的专业嵌入模型竞争,但这些对比仍来自公司披露,结果取决于具体任务。

随着多模态搜索逐渐成为个人资料库、企业知识库和智能体工具的基础能力,足够轻量的嵌入模型有望降低延迟、云端费用和数据传输量。不过,实际效果仍取决于硬件支持、索引流程,以及应用自身的检索逻辑。

为什么重要:EmbeddingGemma 2把多模态能力从昂贵的生成环节,推进到更便宜、更基础的系统组件。若开发者将其部署在本地,竞争优势可能不再体现在聊天演示,而体现在设备能否直接搜索私有的混合媒体数据。

信源