Perplexity发布支持图文检索的新嵌入模型
Perplexity推出0.6B和9B两款迟交互嵌入模型,让文本、图像与渲染PDF页面进入同一检索空间。
Perplexity发布pplx-embed-v2-late嵌入模型系列,包含两款迟交互模型,目标是在统一表示空间中检索文本、图像和渲染后的文档页面。该产品承接公司此前推出的上下文嵌入模型,进一步把竞争推进到搜索和智能体系统背后的检索层。
与把整篇文档或查询压缩成单一向量的做法不同,这两款模型会为输入保留多个向量。这样一来,查询中的不同部分可以分别匹配页面中的不同区域,从而保留单向量检索容易丢失的局部细节。Perplexity还表示,模型支持文本到图像检索,包括直接搜索渲染后的PDF页面,而不必先把每一页完整转换成可读取文本。
此次发布包含一款6亿参数的查询编码器和一款90亿参数的索引模型。Perplexity的设计明显将两者分工:较小模型负责查询侧调用,较大模型用于建立搜索索引。对实际部署而言,这意味着查询端可以保持较轻,而更昂贵的计算主要发生在离线或索引阶段。
这不是一场显眼的通用大模型发布,却击中了AI搜索和智能体能否找到可靠证据的基础环节。多模态检索有望改善图表、页面布局和图像密集报告的访问效果,但最终收益仍取决于索引成本、延迟、授权和独立评测。它释放出的战略信号很明确:模型竞争正深入检索栈,而更好的表示方式会影响后续每一次生成调用。