Perplexity 发布 Lily,本地千问推理提速最高1.35倍
据Perplexity测试,这款面向苹果芯片的Rust与Metal专用引擎,在M5 Max上运行千问模型的速度最高较MLX-LM提升1.35倍。
为单一模型量身打造
Perplexity 发布了本地推理服务器 Lily,专门用于在苹果芯片上运行 Qwen3.6-35B-A3B,并表示将于近期开放源代码。它以 Rust 管理模型加载、会话状态和生成流程,通过自定义 Metal 内核执行计算,并提供精简版 OpenAI 兼容聊天接口;整个推理链路不依赖 PyTorch,也不经过苹果的通用框架 MLX。
Lily 目前只接受一个指定的四位量化检查点。Qwen3.6-35B-A3B 总参数量为350亿,但每个词元仅激活约30亿参数:系统从256个专家中选择八个,并同时调用一个共享专家。量化后的模型文件为19.4GB,网络结构则由十层完整注意力与30层 Gated DeltaNet 循环层组成。Perplexity 据此固定结构,针对数据搬运、任务调度和计算内核逐项优化。
提速明显,适用面仍窄
Perplexity 在配备40核 GPU 和128GB统一内存的 M5 Max MacBook Pro 上测试称,在256至12.8万词元的不同长度下,Lily 的提示词处理吞吐量平均为 MLX-LM 的1.23倍,生成吞吐量平均为1.35倍。在提示词和生成上下文均约4000词元时,两项速度分别达到每秒5749.9和186.6词元;MLX-LM 对应成绩为4737.5和140.9。
这些增益主要来自让专家路由和循环状态持续留在 GPU、融合运算以减少中间数据读写,并根据上下文长度切换注意力执行路径。一次失败尝试同样值得注意:推测解码在单请求场景下反而让速度下降18%,原因是候选词元形成了低效计算形状,并分散了对专家权重的访问。
这仍是一项由开发者自行完成、范围严格受限的对比。Perplexity 表示,Lily 要求 M5 及更新芯片、macOS 26和指定量化模型,不支持其他尺寸的千问模型、稠密模型,也不兼容常见的 GGUF、AWQ或GPTQ格式。由于源代码尚未公开,外部开发者目前还无法复现实测或检查具体实现。
这项发布的意义在于,本地 AI 的下一阶段性能提升可能更多依赖模型架构、运行时与具体设备的协同设计,而非完全交给通用框架。Lily 的官方测试显示专用路线可能带来可观收益,但在代码正式开放前,加上目前仅支持单一模型,它能否扩展为长期可用的平台仍有待验证。