⚡ 猫叔的AI资讯雷达
Agent研究产业模型

智谱公布早期RSI实践:GLM智能体优化自身推理系统

智谱称,GLM-5.3驱动的基础设施智能体参与优化十万级国产算力集群,使GLM-5.3-Flash服务性能提升约3.2倍。

智谱公布了什么

智谱发布了一项被其称为递归自我改进早期形态的实践:由 GLM-5.3 驱动的基础设施智能体,参与优化承载 GLM-5.3-Flash 的推理系统。该系统从模型首次在国产加速器集群上成功运行,到能够承载生产流量,用时约两周。

智谱表示,优化完成后端到端吞吐能力提升约3.2倍。集群规模超过10万颗国产 AI 加速器,同时需要支持百万级上下文、多模态请求,以及仍在完善中的国产芯片软件和通信生态。

智能体具体做了什么

这套系统并不是让模型自主决定训练路线,也不是让它直接重写模型。基础设施团队先搭建了工程闭环,再让智能体分析瓶颈、提出修改方案、完成部分代码调整,并通过正确性和性能实验验证结果。

智谱披露的案例包括:发现长上下文并行路径中的数值误差累积,定位 KV Transfer 与 DeepEP 调度未能有效重叠的问题,以及发现 Decode Kernel 重复执行归一化计算。公司称,其中一项调度修复将传输额外开销从超过30%降至1%以下;另一项内核优化则让特定负载性能提升1.71倍。

智谱将这套方法称为“稠密反馈”:智能体拿到的不是一个笼统的吞吐指标,而是与具体代码路径、算子、输入条件和执行过程相关,且能够快速验证的局部反馈。工程师仍负责设定目标、搭建实验环境,并审核高风险改动。

为什么重要

这项工作的意义不只是模型能够编写基础设施代码,而是部分工程判断被组织成了机器可以执行的流程。如果这种方法能够推广,生产 Trace、微基准测试和正确性检查,都可能成为下一代智能体训练与评测的数据来源。

不过,这还不是完整意义上的递归自我改进。当前智能体只是在人工设定边界和监督下,优化一套具体的部署系统,并没有自主修改自身权重或提出新的目标。它仍然值得关注,因为推理效率、国产硬件适配能力和系统调试经验,正在成为中国模型规模化部署的关键约束。

信源