⚡ AI专注速报
Agent开源研究

Together AI 开源 ThunderAgent,智能体推理吞吐翻倍

ThunderAgent 以整段智能体工作流为调度单元,单台 8×H100 上吞吐约为 SGLang 的两倍、延迟仅其六分之一。

Together AI 于 7 月 29 日开源 ThunderAgent——一个位于智能体客户端与推理引擎之间的调度层,它把「一整段多轮智能体工作流」而非单次模型调用作为调度单元。

它要解决的是 KV 缓存反复失效的问题。当智能体暂停下来执行工具调用时,传统调度器只看到一个空闲请求,于是驱逐它的注意力缓存去服务其他流量;等智能体恢复,这部分状态又得重算。在成千上万个智能体程序并发、且各自频繁暂停的规模下,重算开销会成为主导。ThunderAgent 的做法是让客户端在请求里加一个 program_id 字段,调度器据此即可判断哪些调用属于同一工作流并保持其缓存连贯。内存紧张时,它会整体暂停低优先级程序,而不是把所有人的缓存一起打碎,从而让存活下来的工作流获得高得多的缓存命中率。

官方给出的数据:单台 8×H100 节点、批量 192 时,ThunderAgent 维持 803 tokens/s、平均延迟 10.6 秒,而 SGLang 降至 390 tokens/s、延迟 65 秒——吞吐约翻倍,延迟只有其零头。多节点场景下,GPU 从 16 张扩到 64 张,吞吐由每分钟 671 步近线性提升到 2248 步,且相对 SGLang 网关的优势随集群规模扩大,从 2 节点的 1.79 倍拉大到 8 节点的 2.39 倍。Together 还称在强化学习 rollout 负载上取得 1.8—3.9 倍提升,合成数据生成过程中存在同样的暂停—恢复模式。

项目被定位为「即插即用」:格式无关,可与 KV offloading、投机解码等既有引擎特性叠加而非替换。代码已上 GitHub,配套论文入选 ICML 2026 Spotlight。

为何重要: 现有服务基础设施是为聊天设计的——短促、自包含的请求;而增长最快的流量却是长时间运行、频繁空转的智能体程序。在调度层不改模型、只加一个字段就拿回 2 倍吞吐,能立刻压低智能体的生产运行成本;而它以开源形式落地,而非成为某家推理厂商的私有优势。

信源