Meta最近发布了自研加速器MTIA 300,这是他们第一款专门为排序和推荐模型训练设计的芯片。解决的核心问题,正是加速器之间的通信瓶颈。MTIA 300 把网络接口直接封装进芯片里,提供了 1.2TB/s 的 I/O 带宽,再加上自研的集合通信库,在训练 1500 亿参数的推荐模型时,通信耗时能压到 GPU 集群的四分之一左右。
为什么推荐模型训练会卡在通信上?
关键在于嵌入表。推荐模型的嵌入表通常扛着超过 99% 的参数。训练的时候,这些参数要在加速器之间反复同步,于是产生了海量的集合通信操作。加速器数量一多,网络开销和计算量几乎一样大,很多时候其实是算力在等数据——芯片再快,也只能干等着。
MTIA 300:把网络接口塞进芯片封装
MTIA 300 的设计思路很直接:把网络接口塞进芯片封装。具体配置如下:
- 两个网络芯粒 + 十二个定制 800Gbps RDMA NIC,总共提供 1.2TB/s 的 I/O 带宽
- 16 个专用消息引擎,独立处理通信任务
- 近内存归约硬件,让大型矩阵运算和集合通信并发执行
这样一来,数据进出芯片不再需要绕道 PCIe 总线,延迟和功耗都明显下降。实测计算吞吐量只降了不到 0.5%,而对比的 GPU 架构在同类场景下损耗超过 20%。
软件同步:HCCL 让通信自己跑起来
光有硬件还不够,软件也得跟上。Meta 自研的集合通信库 HCCL 和硬件是协同设计的,它会把集合操作编译成消息引擎能自主执行的子图。这样一来,运行时主机 CPU 就不用逐次去编排通信,压力小了很多。
生产环境里,HCCL 在单个机架内能跑到最高 940GB/s 的通信带宽。用一个部署在 40 个加速器上的 1500 亿参数推荐模型来举例:和同等规模的 GPU 集群相比,MTIA 300 把总通信耗时降到了原来的四分之一左右。
Meta 的下一步和行业风向
Meta 目前已经在生产环境部署了数十万颗 MTIA 加速器用于推理,未来两年还会推出四代后续产品,覆盖排序、推荐和生成式 AI。同时,和博通的合作也在扩大,AMD、英伟达的加速器照样继续买。这个策略很明确:自研芯片不是为了替代所有供应商,而是要把关键负载的性能做到极致。
这也不是 Meta 一家在这么做。谷歌在扩展 TPU,亚马逊在壮大 Trainium,微软也在搞 Maia 的后续产品。超大规模云服务商几乎都在往工作负载专用芯片的方向倾斜。
对大多数企业来说,跟着 Meta 自研芯片不现实。更实际的是选对云服务商。如果你正在评估企业上云的成本,找一家靠谱的阿里云代理商,往往比一头扎进自研芯片更务实。像易枫顺 - 阿里云官方旗舰级代理商这样的角色,能帮你把资源集中在业务上,而不是耗在基础设施的泥潭里。
FAQ
Q: MTIA 300 和普通 GPU 的核心区别在哪?
A: 主要在通信架构。MTIA 300 把网络接口封装进芯片,提供 1.2TB/s 的 I/O 带宽,还带了 16 个专用消息引擎来处理通信,所以集合通信几乎不会拖累计算。普通 GPU 依赖外部网络和 PCIe,在同样场景下吞吐量损耗要高得多。
Q: 这种芯片只能跑 Meta 的推荐模型吗?
A: 目前确实主要是为排序和推荐模型设计的,尤其是嵌入表巨大、需要大量集合通信的训练任务。未来会扩展到生成式 AI。对普通企业来说,不一定要自研芯片,通过云服务商也能拿到类似的高性能计算资源。
Q: Meta 自研芯片会影响英伟达的生意吗?
A: 短期内不会。Meta 还在继续采购英伟达和 AMD 的加速器,自研芯片只针对自家最重的负载。长期看,超大规模云厂商自研专用芯片会越来越多,但通用 GPU 在处理多样化和未知负载上依然有优势。
关于易枫顺
深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺
来源:InfoQ