返回首页
[ 头条新闻 ] 2026-09-19 13:27

GLM-5.3加持的Infra Agent:十万国产芯片集群性能提升3倍,AI递归自我改进初现端倪

GLM-5.3加持的Infra Agent:十万国产芯片集群性能提升3倍,AI递归自我改进初现端倪

智谱AI公布了一项新进展:由GLM-5.3驱动的Infra Agent,在超过10万张国产芯片的集群上完成了模型适配和性能优化,不到两周时间,端到端吞吐量就达到了原来的3倍。与此同时,他们打造的推理系统Ox-Alpha上线仅6天,token调用量就超过62万亿,一周内在OpenCode和OpenRouter上登顶。AI已经开始参与构建自己的下一代,这算是递归自我改进的雏形。

十万张国产芯片上,Agent多线作战

Infra Agent这次接到的活儿,是在一个超过10万张国产芯片的集群上干活,内容包括模型适配、系统诊断和性能优化。这工作量听起来需要一个庞大的运维团队,但这次干活的,是由GLM-5.3驱动的Agent。

结果出乎不少人意料。不到两周,端到端吞吐就提升到了初始基线的3倍。以前跑一遍任务要三个小时,现在一个小时就能完成。这种提升放在企业上云的场景里,相当于白得了两倍的算力。

更关键的是,GLM-5.3-Flash的全部线上推理,都跑在同一个团队搭建的生产级推理系统上。这个系统以匿名模型Ox-Alpha的身份上线后,一周内就成了OpenCode和OpenRouter两个平台上调用量最大的模型,6天token调用量累计超过62万亿。就算放到整个行业里,这个数字也相当有分量。

稠密反馈:让Agent自己发现问题、验证修改

Agent能在陌生的大规模集群上快速干活,靠的不是蛮力。智谱团队提出了一套“稠密反馈”机制:把正确性测试、运行日志、执行Trace、微基准测试和端到端指标,整合成局部、及时且可客观验证的反馈信号。简单来说,就是给Agent每一步操作配了一把“对错标尺”,而不是让它黑箱操作。

这套机制在实际案例中表现很能打。拿KDA算子来说,Agent通过并行切分与非切分路径的精度对比,发现上下文并行路径的误差根源,在于tl.dot默认使用了TF32精度。Agent把精度改成tf32x3后问题解决,相关修复已经合并到Flash Linear Attention上游的PR #1180。

另一个系统行为案例更有意思。Agent发现Prefill+KV Transfer合并后的性能,比单独Prefill差了超过20%。一路追查下去,定位到DeepEP的intranode_dispatch和intranode_combine没有释放GIL,导致Mooncake Transfer线程被堵死。修复之后,性能差距从20%以上压到了1%以内。这种问题如果靠人工排查,有经验的工程师也得折腾好几天。

三倍吞吐背后的工程细节

性能优化方面,Agent没有从零开始造轮子,而是从SGLang、Flash Linear Attention、DeepGEMM这些现成的Kernel里提炼优化骨架,用来优化KDA Decode算子。其中两个动作很有代表性:除法优化让执行时间缩短了9.6%,合并分块消除了重复计算,带来1.71倍的性能提升。

这种做法说明Agent不只是会写代码,更像是在已有的工程积累里找规律、复用模式。智谱团队把工程师、Infra Agent和实验环境组合成了一个优化闭环:工程师定义目标和约束,Agent提假设、改代码,再通过分层反馈验证结果;验证通过的经验会回流到骨架库,供后续优化使用。

这种循环一旦跑起来,迭代速度远非人力可比。对于正在规划企业上云、评估云服务器ECS预算的团队来说,AI辅助调优的思路,或许比单纯加硬件更划算。关于算力选型和成本优化,可以找专业的服务商聊聊,比如易枫顺 - 阿里云官方旗舰级代理商

递归自我改进:边界在哪里

智谱团队对这个进展的判断,冷静中带着审慎。他们认为,AI已经从早期的“辅助人类研发模型”阶段,走向了参与构建自身继任者的新阶段。这属于递归自我改进的早期形态,还不是完整实现——目标选择、边界设定和风险判断,仍然由人来决定。

这个边界感很重要。Agent可以自己修bug、调性能、优化流程,但方向性的问题还得由人来定。就好比一艘船,Agent能不断调整帆的角度,但往哪个方向开,还是船长说了算。

FAQ

Q: Infra Agent在十万张国产芯片集群上具体完成了什么?

A: 它完成了模型适配、系统诊断和性能优化,覆盖正确性修复、系统行为排查和算子性能提升三类任务。不到两周,端到端吞吐提升到了初始基线的3倍。

Q: 稠密反馈机制是什么?

A: 简单说,就是把正确性测试、运行日志、执行Trace、微基准测试和端到端指标组织成局部、及时、可客观验证的反馈信号,让Agent能自己定位问题、验证修改,而不是每一步都靠人来判断。

Q: 递归自我改进已经实现了吗?

A: 还没有完整实现。智谱团队认为这是递归自我改进的早期形态,AI确实在参与构建自身继任者,但目标选择、边界设定和风险判断仍然由人类负责。

关于易枫顺

深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺

易枫顺 - 阿里云官方旗舰级代理商

来源:InfoQ

微信扫码咨询

微信二维码