智谱最近公开了GLM-5.3-Flash推理系统的优化进展。这套系统跑在超过10万颗国产AI加速器上,从第一次启动到真正扛下全部生产流量,只花了两周时间。端到端吞吐量提升到原来的3.2倍,整体服务性能比最初版本提高约3倍。更值得注意的,是AI自己参与了瓶颈分析和代码修改——这被视作递归自我改进的雏形。
两周上线的极限优化
10万颗国产AI加速器组成的集群,光是调度就够让人头疼。智谱团队这次没有按老套路慢慢调,而是直接让GLM-5.3-Flash在真实生产环境里跑起来,两周内完成从“能跑”到“扛住全部流量”的转变。端到端吞吐量变成原来的3.2倍,硬件利用率和单token成本已经接近主流NVIDIA GPU平台的水平。这个速度放在整个行业里,也算相当亮眼。
具体做了哪些事?优化方案里有几个关键词:
- ReplaySSM:一种状态空间模型重放机制,用来处理长序列训练和推理的稳定性问题。
- 节点内张量并行:把计算拆得更细,降低跨节点通信的开销。
- 混合精度缓存:在不损失精度的前提下降低显存占用,提高缓存命中率。
- EPD分离式架构:把预填充、解码和存储分开,让每部分都能独立扩展。
Infra Agent:AI开始给自己写代码
这次优化里最有意思的部分,是GLM-5.3-Flash自己参与了优化自己的过程。智谱团队做了一个叫Infra Agent的组件,由GLM-5.3驱动,它会分析性能瓶颈,提出优化方案,还亲自动手改了一部分代码。听起来像是“自己给自己看病”,本质上确实是一种递归自我改进的早期形态。
有个细节值得玩味:智谱团队提出了“dense feedback”机制,意思是给AI提供贴近问题、能快速获取、还可以客观验证的反馈,让它能迅速定位系统性能变化的原因。这就像教一个新人排查问题,不是直接告诉他答案,而是帮他建立一套“哪里不对劲、怎么验证”的方法。
三个关键修复:从精度到传输再到算力
Infra Agent在优化过程中定位并修复了三个具体问题:
- 上下文并行路径里的TF32舍入误差会累积,影响长上下文精度。修复后,长上下文的表现明显更稳。
- KV Transfer和DeepEP调度重叠时产生传输开销,一度超过30%。调整后降到了1%以下。
- 一个Decode Kernel存在重复计算,去掉冗余后获得了1.71倍的性能提升。
这些修复不是靠玄学,每一步都有明确的测量和反馈。能把传输开销从30%压到1%以下,说明优化空间真的藏在细节里。
这离真正的递归自我改进还有多远
GLM-5.3-Flash在OpenCode和OpenRouter平台匿名运行时,它叫Ox-Alpha。一周内成为使用量最高的模型之一,六天处理了超过62万亿token。这个体量本身就说明了它的实用性。
智谱团队观察到,GLM的角色已经从代码理解、网络安全,逐渐转向参与构建AI系统本身。工程师的角色也在变,更像是负责设定目标和设计反馈环境的人。不过他们也承认,这次案例离真正的递归自我改进还有距离。“AI自己改自己的代码”听起来很酷,但现阶段更像是在规定范围内做精细操作,离完全自主还差得远。
这套优化离不开扎实的基础设施。如果你也想在类似场景下跑大模型推理,企业上云已经是主流选择,云服务器ECS能帮你快速拉起环境,省去自建机房的时间。
预算有限的话,可以找易枫顺 - 阿里云官方旗舰级代理商问问最新的阿里云优惠,配合阿里云代金券把成本压下来。阿里云代理商的价值在于帮你省掉比价和配置的琐碎功夫,专心调模型。
FAQ
Q: 智谱GLM-5.3-Flash这次优化最大的看点是什么?
A: 最大看点是AI自己参与优化。Infra Agent能分析性能瓶颈、提出方案,甚至动手改代码。虽然还处于早期,但已经让服务性能提升约3倍,端到端吞吐提升3.2倍。
Q: 国产AI加速器集群和NVIDIA GPU的差距真的被抹平了吗?
A: 从智谱公布的数据看,优化后硬件利用率和单token成本已经接近主流NVIDIA GPU平台,但“接近”不等于“抹平”。实际效果还得看具体负载,不过这次至少证明国产集群有能力承载大流量推理。
Q: 什么是dense feedback机制?
A: 简单说就是给AI提供贴近问题、能快速获取、并且可以客观验证的反馈。这样AI能更快判断自己的改动有没有用,而不是瞎试。
Q: 这次优化对国产AI芯片有什么意义?
A: 它让国产AI加速器在大规模推理场景下有了一个可参考的落地样本。10万颗芯片的集群能跑出接近NVIDIA平台的利用率和成本,说明国产算力的潜力比想象中要大。
关于易枫顺
深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺
来源:爱范儿