智谱披露RSI工程进展:Agent参与优化10万卡集群,吞吐升至3倍
产联社编辑 | 开蓉蓉

图片由AI生成
【产联社】智谱正在尝试让AI优化自身运行的基础设施。9月17日,智谱创始人兼首席科学家唐杰在X平台发布长文并转发智谱技术博客,披露智谱在递归自我改进(Recursive Self-Improvement,RSI)方向的最新工程进展。
据智谱方面介绍,在超过10万张国产芯片组成的集群上,由GLM-5.3驱动的Infra Agent参与搭建了支撑GLM-5.3-Flash的生产级推理服务,从首次运行到承担全部生产流量用不到两周,端到端吞吐提升至初始基线的3倍。
唐杰表示,这并非完整意义上的RSI,但最小闭环已经出现:模型优化系统,系统服务于模型。他同时表示,人类仍定义目标、构建反馈环境并审查高风险变更,工程师角色正从解决问题转向设计反馈。智谱未披露芯片厂商具体名称。
两周完成从适配到生产,吞吐提升至三倍
据智谱技术博客,GLM-5.3-Flash上线面临多重约束。集群规模超过10万张国产加速器,芯片内存容量与互联带宽相对受限,模型需支持1M token上下文窗口与多模态请求,软件栈不成熟,算子不完备,文档常需推测。
智谱方面称,团队实施内存优化,包括以算力换带宽、以通信换显存等方案,并引入节点内张量并行、ReplaySSM、混合精度缓存量化及Encode-Prefill-Decode分离式架构,端到端服务性能约3倍提升,硬件利用效率与单Token成本达到主流NVIDIA GPU相当水平。
智谱方面称,Infra Agent参与的反馈闭环贯穿优化过程。GLM-5.3-Flash以匿名模型Ox-Alpha在OpenRouter等平台接受真实调用检验,上线一周成为双平台调用量最大模型,6天token调用量超过62万亿。唐杰称,这项工作过去需要一支资深Infra团队花费数周完成,此次主要由GLM-5.3驱动的Infra Agent承担。
“稠密反馈”把系统问题拆成可验证信号
智谱将正确性测试、运行日志、执行Trace、运行时事件、微基准测试和端到端指标纳入Agent迭代流程,称为“稠密反馈”。
智谱方面称,稠密反馈强调三项特征:反馈足够局部,关联具体参数、代码、算子、输入条件或代码路径;反馈低成本及时获得,无须每次等待完整服务器部署和端到端压测;反馈支持客观验证,由参考实现、测试结果和可比较实验指标判断。
智谱方面称,工程师定义目标与系统边界,Agent负责分析、假设和修改,实验环境提供分层、及时且可验证的反馈,三者共同将原本依赖工程师经验串联的诊断过程,转化为Agent可以持续执行的工程工作流。
精度、并发与算子问题被逐一验证
正确性反馈方面,智谱方面称,Agent在KDA算子上下文并行路径中发现精度偏差。原实现中t1.dot默认采用TF32计算,误差在状态合并与更新中累积,长上下文下更明显。修复方案为显式指定input_precision="tf32x3",通过三次TF32 Tensor Core运算组合出更高精度结果。相关修复已合并至Flash Linear Attention上游,PR编号1180。
系统行为反馈方面,智谱方面称,Agent发现部分场景Prefill加KV Transfer与单独Prefill性能差距超过20%。分析后定位到DeepEP v1.2.1中intranode_dispatch和intranode_combine未显式释放Python GIL,导致Mooncake Transfer的Python线程无法及时获得GIL。修复后在相关C++执行区间释放GIL,性能差距缩小至1%以内。
性能反馈方面,智谱方面称,Agent从SGLang、Flash Linear Attention和DeepGEMM等项目存量Kernel中提炼优化经验,形成包含适用条件、变换方式、资源约束和验证证据的“优化骨架”。典型KDA Decode算子经分块合并与共享中间结果,获得1.71倍性能提升。
融资六成投向RSI,安全边界仍由人守
智谱于9月13日宣布完成约50亿美元融资,约60%将用于下一代GLM基础模型和安全自训练体系研发,以及大规模训练、生产推理、算力资源和相关技术基础设施部署与升级,最终逐步形成RSI。
智谱公告指出,下一代GLM模型将在上一代GLM所搭建环境中训练,涵盖数据自产、环境自造、基础设施自我优化三个维度。数据自产通过模型间自我对弈、规则校验、执行验证等方式自动生成和筛选训练数据;环境自造让智能体采集和转化真实世界任务;基础设施自我优化即本次披露的Infra Agent实践。
安全方面,智谱方面称,公司于2025年10月启动安全能力增强研究,合作伙伴使用GLM在真实代码库中发现数千个漏洞,公司为此设计受信访问计划。唐杰表示,选择目标、设定边界、判断风险仍是人的工作,在相当长时间内这条线应由人来守。
工程师承担三项关键职责:定义优化目标与系统约束,构建Agent可直接使用的反馈环境,审核涉及系统架构、异步并发和线上风险的关键修改。
Agent提出假设、实施修改并执行实验,再根据反馈保留、修正或否定当前方案。正确性、稳定性与端到端性能共同构成最终验收标准。唐杰称,两周、三倍、十万卡这些数字表明,这条线不会因主观意愿而放缓。
信息来源说明:唐杰X平台长文、智谱技术博客、智东西及InfoQ等公开报道。
免责声明:本文仅供参考,不构成任何投资建议。
商务合作,请联系李先生 15712907343(微信号Ime1660217962)
报料及内容合作,请联系微信号chanlianshe2026
特别声明:本文仅供参考,不构成任何投资建议,未经允许不得转载。

