智谱 GLM 首席科学家唐杰在 X 平台分享了 GLM-5.3-Flash 推理系统优化的研究。从模型首次运行在国产 AI 加速器上,到完成全部生产流量承载,只用了两周,系统端到端吞吐能力提升 3.2 倍。唐杰提到,参与大量优化工作的除了基础设施工程师,还有由 GLM-5.3 驱动的 Infra Agent,他称之为“一个帮助优化服务自身的模型”。在他看来,AI 已开始参与优化承载自身运行的系统,距离真正的递归自我改进(RSI)仍远,但早期形态已经出现。

过去一年,智谱团队观察到 GLM 的角色在变化。最初他们探索其在代码理解和网络安全方面的能力,希望帮助分析复杂代码中的漏洞;随着能力提升,GLM 开始参与构建 AI 系统本身。团队提到,模型曾完成过去需要资深基础设施工程师团队花费数周的任务,这些工作又会影响下一代模型的训练和部署方式。
这次部署运行在超过 10 万颗国产 AI 加速器组成的集群上,此前缺少成熟经验参考。团队需要应对国产芯片显存容量和互联带宽限制、新模型架构适配、100 万 token 长上下文支持以及多模态请求处理等问题,部分 Kernel 支持不足,很多资料要靠工程团队自行探索。Infra Agent 帮助分析性能瓶颈、提出优化方案并完成部分代码修改。优化并非简单增加算力,而是在算力、内存、通信和调度间寻找平衡:ReplaySSM 用计算换内存,节点内张量并行降低显存压力,INT8、FP8、BF16 混合精度缓存提高容量利用率,EPD 分离式架构让不同推理阶段调度更灵活。最终端到端服务性能相比初始版本提升约 3 倍,硬件利用率和单 token 成本接近主流 NVIDIA GPU 平台水平。
部署后,GLM-5.3-Flash 以匿名模型名 Ox-Alpha 在 OpenCode 和 OpenRouter 平台运行,一周内成为两个平台使用量最高的模型之一,六天处理超过 62 万亿 token。唐杰指出,关键变化不只是让 AI 写代码,而是让它理解系统为什么出现性能变化。Infra Agent 的困难很少在于无法写代码,而在于无法判断“为什么结果变差”:系统只反馈“吞吐下降 20%”,并不能说明哪一层出了问题、假设是否正确、下一步验证什么,这类判断原本依赖资深工程师的长期经验。智谱希望把这种经验转化为 AI 可调用的反馈机制,称为“dense feedback”。






