2026年10月22日至24日,QCon全球软件开发大会将在上海举行,这次的主题很明确——AI Native时代的工程实践。上海交大副教授杜冬冬将分享基于RhymeRL的强化学习系统优化方法,这项研究瞄准的是Rollout阶段耗时占比高、GPU大面积空闲的痛点,实测吞吐最高能提升2.6倍。
大会概况:不只是技术会议,更像工程风向标
这次QCon上海站规模不小,一口气设置了20个专题论坛,邀请百余位专家上台分享。整个会程核心就一件事:AI原生应用大规模落地时,工程层面到底怎么扛住压力。从智能体到基础设施,每个专场都对应着实打实的交付难题。
AI Infra专题:为什么盯上强化学习后训练?
在AI Infra专题里,杜冬冬的演讲很具体,讲的是基于RhymeRL的强化学习系统优化方法。强化学习的后训练阶段有个绕不开的瓶颈——Rollout阶段,要反复生成样本、评估奖励,计算开销非常大。
杜冬冬团队实测了一些主流工作负载,发现Rollout要占整个后训练耗时的84%到91%。再加上批次内不同样本的响应长度差异很大,GPU干完自己那批活儿的时间参差不齐,最早干完的GPU平均有76%的时间在空转。说白了,钱花了,卡闲着。
RhymeRL怎么破局?靠的是“记住”而不是“重算”
团队分析了真实轨迹数据,发现一个挺有意思的现象:相邻训练轮次的Rollout结果,存在大量能精确匹配的token,而且响应长度的排序比较稳定。既然有大量重复计算,那就有了缓存和复用的空间。
RhymeRL系统做了一套组合拳,具体包括:
- 离线后缀树索引:提前建好索引,快速定位重复token,不用在线建索引,省掉额外开销;
- 奖励感知剪枝:提前拦掉明显没价值的样本,节省计算资源;
- 动态草稿窗口:不再用固定窗口,灵活性更高;
- 奇偶步互补调度和尾部迁移:专门对付异常长样本和尾部计算不均的问题。
效果如何呢?和现有系统比,RhymeRL端到端吞吐最高能提升2.6倍。其中那块叫HistoSpec的组件,在单步Rollout场景下,吞吐最高提升了1.86倍。对跑大模型训练的人来说,省下的电费非常可观。
从论文到工程:AI Native时代的落地思考
杜冬冬长期搞操作系统和智能体系统研究,成果发在SOSP、OSDI这些顶级会议上,还拿过SOSP 2025最佳论文奖和FAST 2026最佳论文奖。这些经历说明他做的东西都是经过真实系统检验的。
回到AI Native这个主题,大模型训练和部署越来越像传统云资源的精细化管理。企业要跟上这波浪潮,上云是第一步。如果你正打算把手上的训练任务迁到云上,又怕踩坑,找一个靠谱的服务商能省不少心。比如易枫顺 - 阿里云官方旗舰级代理商,既能帮你申请阿里云优惠和代金券,又能打包解决云服务器ECS的选型、部署问题。企业上云没那么玄乎,关键是有人帮你把资源调度和设备配置理顺。
说到底,无论是杜冬冬的RhymeRL还是云厂商的弹性资源池,核心思路都一致:让硬件更忙,让应用更快。
FAQ
Q: RhymeRL主要解决什么问题?
A: 它主要解决强化学习后训练里Rollout阶段耗时太高、GPU空闲率过大的问题。通过复用相邻轮次的重复token,把端到端吞吐最高提升了2.6倍。
Q: 2026 QCon上海站有哪些值得关注的看点?
A: 大会围绕AI Native时代工程实践,设置20个专题论坛,覆盖AI Infra、智能体、性能优化等方向,邀请百余位专家分享。杜冬冬的RhymeRL就是其中很亮眼的一个。
Q: 企业参加这类大会或关注相关技术有什么实际帮助?
A: 可以了解最新的工程实践,避免在技术选型上走弯路。如果正在考虑企业上云,还能借机了解云服务器ECS的部署方式,顺便找阿里云代理商谈谈优惠,一举两得。
关于易枫顺
深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺
来源:InfoQ