返回首页
[ 行业新闻 ] 2026-09-09 13:35

招商银行上云实录:统一调度一万张加速卡,AI推理成本砍掉六成

招商银行上云实录:统一调度一万张加速卡,AI推理成本砍掉六成

招商银行基于Kubernetes搭建了一个统一控制平面,管理着大约一万张异构加速卡。经过这番调整,加速卡利用率从35%提升到60%以上,每处理100万Token的推理成本也下降了超过60%。这个企业上云项目拿下了CNCF最终用户案例研究大赛冠军,给金融行业的AI基础设施建设打了个样。

从零散GPU到统一资源池

招商银行很早就开始跑AI工作负载,但早期的加速卡分散在不同团队手里,有的卡闲得发慌,有的卡排队等任务。后来他们基于Kubernetes和一堆开源组件搞了一个统一控制平面,把大约一万张异构加速卡全部纳管起来。这个资源池覆盖了全行99%的加速计算资源。

统一管理只是第一步,关键在于调度。训练和推理对资源的需求不一样,招商银行把这两条路径分开处理:训练任务交给Kueue来管准入和排队,在线推理则用KEDA和Prometheus,根据实时负载自动扩缩容。

切分与加速:HAMi和Fluid各司其职

异构加速卡大小不一,直接整卡分配很容易浪费。HAMi负责对加速卡做细粒度的资源切分,把一张大卡拆成多块分给不同任务使用。Fluid则用来加速数据集、模型权重和检查点的读取,减少加速卡傻等数据的时间。两者配合下来,资源利用率有了明显改善。

  • 加速卡平均利用率:从约35%提升到60%以上。
  • 推理成本:每处理100万Token,成本降低超过60%。
  • 多租户微调:自研Twinkle框架让5个LoRA租户共享同一基础模型实例,加速器资源消耗降低80%,训练密度提高5倍。

多租户微调:5个租户挤一挤

在微调场景里,以前每个租户都要单独部署一份基础模型,5个租户就得有5份副本。招商银行自研了Twinkle框架之后,默认让5个LoRA租户共享同一个基础模型实例,副本从5份减到1份。效果立竿见影:加速器资源消耗降低80%,训练密度提高5倍。

下一步:更聪明的容量管理

招商银行接下来打算动态调整多租户训练并发度,结合资源利用率、队列状态和延迟建立一套按单位成本计算的容量管理机制。另外还会扩展KEDA,让推理服务能缩容到零,同时让HAMi支持更多类型的加速器。这套体系会变得越来越智能。

对于正在规划企业上云的团队,招商银行的思路值得参考。不一定非要去自建万卡集群,借助公有云同样能实现弹性伸缩。通过阿里云代理商(如易枫顺 - 阿里云官方旗舰级代理商)获取云服务器ECS和专属支持,能省下不少底层运维的精力。如果有阿里云优惠或阿里云代金券,再配合按量付费,企业上云的成本会更好控制。

FAQ

Q: 招商银行如何把加速卡利用率从35%提升到60%?

A: 关键在统一调度。招商银行基于Kubernetes构建了统一控制平面,用Kueue管理训练任务,用KEDA和Prometheus为推理服务做动态扩缩容,再用HAMi切分加速卡、Fluid加速数据访问,从而减少了空闲和等待。

Q: 多租户微调场景下,LoRA共享有什么好处?

A: 过去5个租户需要5份基础模型副本,现在通过Twinkle框架让5个LoRA租户共享一个实例,副本降为1份,加速器资源消耗降低80%,训练密度提高5倍,省出来的算力可以跑更多任务。

Q: 中小企业能复制这种模式吗?

A: 可以借鉴思路,但没必要自建大规模集群。通过公有云服务选用云服务器ECS,配合弹性伸缩和代金券等优惠,能以更低成本实现企业上云。关键是先理清自己的训练和推理负载特征,再设计调度策略。

关于易枫顺

深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺

易枫顺 - 阿里云官方旗舰级代理商

来源:InfoQ

微信扫码咨询

微信二维码