Kubeflow 最近一口气放出了不少重磅更新:Kale 2.0 能让 Jupyter 笔记本直接变成生产级管道,Notebooks v2 进入了 alpha,SDK 原生支持 Spark,Trainer 集成了 Flux,Model Registry 也升级成了 Hub。这些变化让企业上云后的 AI 开发流程顺畅了不少,配上云服务器 ECS 这类基础设施,落地门槛低了很多。
Kale 2.0:让笔记本一键变成管道
用过 Kubeflow Pipelines 的人应该清楚,写管道代码是个细活。要定义组件、处理输入输出、编排依赖,稍微走神就掉进 KFP SDK 的坑里。Kale 2.0 正是为这个痛点来的——它能把 Jupyter Notebook 直接转成生产级管道,兼容 Kubeflow Pipelines v2 架构,整个过程完全不用手写一行 KFP SDK 代码。
举个简单的例子,以前做完数据分析,还得请工程师把流程“翻译”成管道;现在只要在 notebook 里把步骤标好,Kale 会自动打包、参数化、生成管道。社区里已经有团队试过,原来要两三天才能跑通的管道,用 Kale 2.0 半天就搞定了。省下来的时间,多跑几个实验不好吗?
Notebooks v2 进入 alpha:平台团队总算能“掌控”环境了
Kubeflow Notebooks v2 这次进入 alpha 阶段,改动确实不小。它用声明式 CRD 驱动架构重写了一遍,什么意思呢?就是平台团队可以像管理 Kubernetes 资源一样,对 JupyterLab、VS Code 这类交互式环境进行模板化控制。你想限制某个团队只能用特定镜像?或者强制每个 notebook 挂载存储?写个 CRD 就行,再也不用靠繁琐的脚本和人工配置了。
对管理员来说,多租户下的环境管理因此变得干净利落。对开发同学来说,环境更统一,也少了很多“在我电脑上能跑”的尴尬。
Spark 原生支持:大数据和 AI 不再各说各话
Kubeflow SDK 这次原生支持了 Spark。以前要在 Kubernetes 上跑 Spark,得自己写一大堆基础设施配置,申请资源、配网络、调参数,每一步都可能劝退。现在简单多了,通过统一的 Python 接口,就能把数据处理、管道编排、分布式训练和超参数调优串在一起。比如你用 Spark 预处理完数据,紧接着交给 Kubeflow Trainer 跑训练,再顺手做个超参搜索,一条流水线全搞定。
这种集成对中小企业尤其友好,毕竟不是每家都有专职平台工程师去维护 Spark on K8s。官方强调这套接口是“原生”的,意味着不用额外装插件,升级维护也更省心。
Trainer 集成 Flux:AI 和 HPC 总算同框了
Kubeflow Trainer 通过和 Flux Framework 集成,能在同一个 Kubernetes 环境里,用 MPI 协调大规模 HPC 模拟和 AI 训练作业。说白了,就是让高性能计算和深度学习共享一套基础设施。搞科学计算的人不用再单独搭一套 HPC 集群,搞 AI 的也不用眼巴巴等 GPU 资源空出来。
举个例子,一个流体力学模拟任务和一个模型训练任务,可以同时跑在 K8s 上,互不干扰,资源还能灵活调配。这种“混部”模式一旦落地,硬件利用率能提升不少。
Hub 和 KServe:模型管理路子更宽了
这次更新里,Model Registry 改名成了 Hub,范围一下扩大了不少。现在它包含 Model Catalog 和 MCP Catalog,还支持用 OCI 作为模型存储标准。也就是说,你可以像管理容器镜像一样管理模型,搜索和部署都更顺手。更妙的是,Hub 能直接搜索和部署 MCP 服务器,这给 Agent 生态带来了不少新玩法。
另一边,KServe 新增了 LLMInferenceService CRD,支持跨节点分布式推理,还兼容 OpenAI API。这意味着你在本地用 OpenAI 写的代码,稍微改改就能指向自己的模型服务。大模型部署的门槛,被一点点拉低了。
安全和兼容:Kubernetes 1.34+ 走起
Kubeflow Community Distribution 26.03 已经验证支持 Kubernetes 1.34 及以上版本,同时加强了多租户默认设置,并且与 Pod Security Standards Restricted 策略兼容。对运维同学来说,这意味着安全合规没掉队。企业要上生产环境,最怕的就是权限漏洞和基线漂移,这次更新算是给大家吃了颗定心丸。
如果你正准备搭 AI 平台,又不想折腾底层基础设施,直接跑在云服务器 ECS 上是个挺省事的选择。不过云上的账单和资源规划也容易让人头疼,这时候找一个靠谱的易枫顺 - 阿里云官方旗舰级代理商能省不少心力。他们能帮你规划 ECS 实例,还能提供 阿里云代金券,变相省下一笔算力成本。当然,要是你刚接触企业上云,先通过阿里云代理商了解一下促销活动,比如阿里云优惠,往往能发现不少实惠。
总结
Kubeflow 这条线的更新一直没停过,从笔记本到管道,从训练到推理,从模型管理到安全合规,每个环节都在往“更简单、更开放”的方向走。你不需要一开始就搞懂所有组件,可以挑几个痛点先试试,比如用 Kale 2.0 把现有 notebook 变成管道,或者用 Spark 接口把数据处理和训练串起来。等跑顺了,再慢慢往生产环境迁移。反正现在只要是 Kubernetes 1.34+,基本都能玩得转。
FAQ
Q: Kale 2.0 对已有的 Jupyter Notebook 兼容性如何?
A: Kale 2.0 面向 Kubeflow Pipelines v2 架构设计,可以自动识别 Notebook 里的代码单元和参数。大部分常规流程(数据清洗、训练、评估)都能直接转换,但如果你用了某些自定义库或非标准交互,可能需要稍微调整一下标记方式。建议先拿个小项目试试水。
Q: Kubeflow Hub 和原来的 Model Registry 有什么不同?
A: Hub 算是 Model Registry 的“升级 plus”版。除了继续管理模型版本,它还加入了 Model Catalog 和 MCP Catalog,支持用 OCI 标准存储和检索模型。你可以把 Hub 理解成模型和 Agent 工具的集市,不光能存模型,还能直接搜索和部署 MCP 服务器。
Q: 新版本对硬件和云资源有什么要求?
A: 基础要求是 Kubernetes 1.34+,支持多租户和 Pod Security Standards Restricted。如果只是小规模测试,几台云服务器 ECS 就够了。要跑大规模训练或推理,建议配置 GPU 实例。预算有限的话,可以留意阿里云优惠活动,或者用阿里云代金券抵扣部分费用。
关于易枫顺
深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺
来源:InfoQ