⚡ 猫叔的AI资讯雷达
模型产业Agent

OpenAI 测试极速版 GPT-5.6 Sol,最高每秒 750 令牌

OpenAI 借助 Cerebras 将旗舰模型推理速度最高提升 14 倍,先向少量客户开放,以验证低延迟场景的商业价值。

让旗舰模型进入交互式延迟区间

OpenAI 推出名为 Ultrafast 的新推理模式,可让 GPT-5.6 Sol 以最高每秒 750 个输出令牌的速度运行。公司称,相比常规模式,速度最高可提升 14 倍。其底层使用 Cerebras 的晶圆级推理系统,而不是服务标准版本的传统 GPU 基础设施。

此次开放范围有意保持有限。OpenAI 正与首批客户共同测试,寻找额外速度能够产生足够实际价值、从而支撑独立服务档位的场景。公司尚未公布全面开放时间和公开价格,因此 Ultrafast 目前更接近真实环境中的部署试验,而不是所有 GPT-5.6 Sol 用户都会获得的默认升级。

这一速度值得关注,因为 Sol 是 GPT-5.6 系列中能力最强的型号,通常用于复杂技术工作与长时间运行的智能体任务。更高的智能水平往往伴随更长输出和更多推理等待时间。如果能稳定达到每秒 750 个令牌,多步推理、代码生成与反复迭代的智能体循环就可能在接近实时的节奏下完成,不必为了响应速度改用较小模型或异步流程。

Cerebras 通过晶圆级处理器缩短模型权重与计算单元之间的距离,以减少大型 GPU 集群常见的通信瓶颈。OpenAI 与 Cerebras 此前已经签署多年合作协议,计划部署大规模高速推理容量;Ultrafast 是这项基础设施合作首次明确转化为产品能力。

为什么重要

AI 的前沿竞争已经不只取决于模型质量。智能体需要反复推理、调用工具、检查结果并重新尝试,每一步延迟都会累积。若能让顶级模型提速一个数量级,实时编程辅助、现场决策支持等过去难以承受等待时间的工作流就可能变得可用。当前最大的未知数仍是价格:在缺少公开成本与广泛访问的情况下,Ultrafast 证明了技术可行性,却尚未证明大众市场的经济性。但它已经迫使推理服务商像模型实验室比拼智能水平一样,开始正面竞争响应速度。

信源