⚡ AI专注速报
开源模型

Liquid AI 开源两款 CPU 友好的 8K 长上下文编码器

LFM2.5-Encoder-230M 与 350M 把 BERT 级模型的上下文推到 8192 token,满长度下 CPU 推理速度约为 ModernBERT-base 的 3.7 倍。

小模型,长输入

Liquid AI 7 月 29 日放出两款双向文本编码器权重:LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M。它们瞄准的是 AI 系统里最不起眼的中间环节——检索、重排、分类与过滤,这些活儿用生成式大模型属于杀鸡用牛刀。

两款模型均基于该公司的 LFM2 混合骨干,把门控短卷积块与分组查询注意力组合在一起,支持 8192 token 输入。在这个参数量级里,此前 512 token 长期是常态,8K 属于相当奢侈的配置。二者隐藏层维度均为 1024,词表 65536,覆盖 15 种语言。

团队没有从零训练,而是把已有的 LFM2.5 解码器改造成编码器,做了三处改动:注意力掩码改为双向、短卷积改为非因果、以 30% 掩码率继续做掩码语言建模训练——这一比例是 BERT 原始 15% 的两倍。

成绩单

在 17 项任务的评测集合上,350M 版本平均分 81.02,在参评的 14 个模型中排第四;230M 版本得 79.29,参数更少却高于 ModernBERT-base 的 78.19。更值得留意的是普通硬件上的吞吐:8K 输入下,230M 编码器在 CPU 上单次前向约 28 秒,而 ModernBERT-base 需要 90 秒以上,差距约 3.7 倍。当嵌入流水线与应用跑在同一台机器、而非独立 GPU 上时,这个差距直接决定体验。

两个权重均已上传 Hugging Face,采用 Liquid AI 自家的 LFM Open License v1.0,而非标准宽松开源协议,商用前需要先看清条款。

为什么重要

编码器是生产环境里的沉默主力:几乎每一套 RAG 系统、内容审核过滤器和语义检索索引都塞满了它们。但这类模型的进步速度远慢于生成模型,ModernBERT 当了好几年默认选项。把 400M 以下的编码器推到 8K 上下文、同时让 CPU 推理仍可接受,意味着能力继续往端侧移动——在那里决定用什么的不是榜单排名,而是隐私、离线可用性和每次调用的成本。

信源