⚡ AI专注速报
模型产业研究

OpenAI 称 GPT-5.6 Sol 把自己的服务成本砍掉 20%

OpenAI 表示,上线后它让 GPT-5.6 Sol 反过来优化自家推理栈,模型自主重写生产 kernel,端到端服务成本下降 20%。

OpenAI 7 月 29 日表示,公司在 GPT-5.6 Sol 上线部署之后,反过来用这一模型去优化承载 GPT-5.6 自身的推理基础设施,由此带来的改动使端到端服务成本下降 20%。

按 OpenAI 的说法,该模型在 Codex 环境中自主重写并优化了生产环境的 GPU kernel——也就是在加速卡上执行模型数学运算的底层代码。OpenAI 把这项能力归因于训练时的刻意投入:模型专门学过 Triton 与 Gluon 这两种由 OpenAI 维护的开源 GPU 编程语言,因此写 kernel 更接近「本职技能」而非涌现副产品。在前向计算中,模型找出了可以预计算、可以直接省掉、以及可以并行化的环节。此外,它还被用于分析生产流量日志、定位服务集群的负载不均来源,相应的负载均衡改造贡献了另一部分成本下降。

OpenAI 将这次实践描述为一系列叠加优化之一,目的是把「成本—智能」曲线整体外推,让每个价位段都能拿到更强的模型,而不只是顶端受益。商业压力也确实指向这里:GPT-5.6 Sol 定价为每百万输入 token 5 美元、输出 25 美元,更便宜的 Terra 与 Luna 档位正是用来承接 Sol 价格吃不下的调用量。

需要注意的是,这一数据来自 OpenAI 自述、未经第三方核验,20% 指的是服务成本而非训练成本或对外价格,因此不必然转化为 API 降价。kernel 层优化对编程模型来说也算是边界清晰的任务:正确性可由机器验证、收益可量化,这恰恰是它成为首选切入点的原因。

为何重要: 眼下限制前沿模型铺开的瓶颈已不是能力,而是推理成本,而智能体类负载的 token 消耗是以十亿计的。一个可量化、在生产环境验证过的「前沿模型提升自身服务效率」案例,是迄今关于「AI 加速 AI」较为扎实的实证之一,且正落在所有实验室与推理服务商竞争的成本命门上。

信源