返回首页
[ 头条新闻 ] 2026-09-16 13:38

AI Agent正在重构云基础设施:Kubernetes与OpenStack如何应对异构算力挑战

AI Agent正在重构云基础设施:Kubernetes与OpenStack如何应对异构算力挑战

AI Agent正在改变云基础设施的调用方式。在KubeCon China 2026上,OpenInfra与CNCF负责人均提到,Kubernetes正借助DRA适配GPU/NPU等异构资源,但真正为Agent原生设计的基础设施层尚未出现。

AI Agent把“人操作”变成了“程序调度”

在KubeCon + CloudNativeCon + OpenInfra Summit + PyTorch Conference China 2026现场,InfoQ与OpenInfra基金会总经理Thierry Carrez、CNCF执行总监Jonathan Bryce聊到了同一个话题:AI Agent正在重塑云基础设施的调用逻辑。

过去,云资源的使用者是程序员或运维工程师。他们通过控制台、CLI申请虚拟机、配置网络、部署应用。现在,Agent可以自动调用API、申请GPU、跑推理任务,甚至自行决定该用哪个模型。Thierry Carrez认为,硬件层与编排层之间还缺少一个合适的开源项目来填补空白,许多创新被封闭在专有环境里,他希望未来能放到开放社区中,按统一标准协作。

Kubernetes DRA:让GPU/NPU像“插头”一样即插即用

Jonathan Bryce在交流中提到一个关键机制:DRA,即动态资源分配。过去Kubernetes要支持某种新硬件,往往需要为核心编写大量定制代码。如今通过DRA插件机制,GPU、NPU等厂商可以直接把硬件能力注册到集群中,由调度器统一分配,无需为每种硬件单独适配。

这项变化的意义在于,AI时代硬件差异直接决定模型性能和成本。同样是跑一个大模型,A卡和N卡的显存、带宽、算子库表现可能完全不同。Kubernetes的调度范围已从相对标准的CPU/内存扩展到GPU、NPU等异构加速器。未来Agent还可能动态提出资源需求,比如“这个推理任务需要4卡”,调度系统就得在异构资源池里实时做出选择。

从Linux到PyTorch:一条跨层协作的AI部署链路

在实际部署中,底层通常是Linux,OpenStack负责管理服务器和硬件资源,Kubernetes做容器编排,上层跑PyTorch或vLLM。Metal3项目让OpenStack裸金属管理与Kubernetes集成,LLMD也与PyTorch体系做了衔接。跨层集成已有实例,但距离“开箱即用”还有不小差距。

对于想上云的企业来说,这条链路有点长。自己搭建OpenStack加Kubernetes,还要解决GPU驱动、网络存储、弹性伸缩等问题,对多数团队并不友好。用云服务器ECS作为上层计算资源,结合Kubernetes和PyTorch跑AI推理,是当前比较务实的路径。想省心的团队,可以关注 易枫顺 - 阿里云官方旗舰级代理商,这类渠道能帮忙把资源配置和预算规划好。

Agent既要资源,也得有“后悔药”

Agent主动调用工具和系统,安全边界发生了改变。以前人操作出了问题,可以通过流程追责;Agent操作速度太快、链条太长,必须有一套机制来记录和撤销。Thierry Carrez强调的不只是隔离,还有可审计性和可逆性:

  • 可审计性:追踪Agent申请过什么资源、做过哪些调用,所有行为留下痕迹。
  • 可逆性:发现错误操作后,能把资源申请和调用结果撤销回滚。

Kata Containers被视为补强隔离能力的核心项目之一。它用轻量级虚拟机包裹容器,让每个工作负载多一道边界。比传统runc容器更硬,又比普通虚拟机更轻。在未来Agent频繁调用外部工具的场景下,这种隔离模式可能成为默认配置。

真正的Agent原生基础设施,仍在路上

目前Kubernetes已经通过DRA、AI Conformance等机制适配异构AI资源,OpenInfra也在继续向上暴露GPU、裸金属等底层能力。CNCF在已有上百家公司参与的Kubernetes Conformance合规体系基础上,又推出了Kubernetes AI Conformance,把兼容性问题从技术接口扩展到了共同治理规则。这说明整个生态都在朝着“AI原生”方向补课。

但必须承认,真正为Agent原生设计的那一层基础设施还没有完全出现。现在的方案大多是拼接:OpenStack管硬件,Kubernetes管容器,DRA管加速器,Agent在外层调用。Agent真正需要的是什么?可能是一个能表达意图、动态申请资源、自带审计回滚的编排层。这个空白,正是未来几年最值得关注的开源机会。

FAQ

Q: AI Agent对普通企业的IT架构有什么影响?

A: 影响主要体现在资源调用和成本上。以前写固定代码部署,现在Agent会动态申请GPU、API、存储。如果底层调度还停留在“按CPU/内存静态分配”,很容易造成浪费或不足。建议先用Kubernetes和云主机搭建一套可弹性扩展的底座,再逐步接入Agent场景。

Q: Kubernetes DRA与传统设备插件有什么区别?

A: 传统设备插件主要解决“设备可见”问题,DRA更接近完整调度。它通过插件机制把GPU等加速器资源统一纳入集群,让调度器知道有哪些资源、多少可用、如何分配。对硬件厂商来说,也不必等待Kubernetes核心为自家硬件单独编写适配代码。

Q: 企业现在想开始用AI Agent,上云是不是更划算?

A: 要看所处阶段。如果只是试验,直接在云上跑PyTorch + vLLM,比自建机房快得多。想进一步控制成本,可以找阿里云代理商,比如易枫顺,把预算花在模型和调优上,而不是耗在底层运维中。

关于易枫顺

深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺

易枫顺 - 阿里云官方旗舰级代理商

来源:InfoQ

微信扫码咨询

微信二维码