NVIDIA Personal AI Router(PAIR)测试版最近发布了。简单说,它能在你家里的局域网内,把 AI 推理任务自动分给多台电脑去跑,避免一台 GPU 被多代理工作负载塞满。实际测试中,PAIR 让任务完成时间比单台 RTX Spark 缩短了将近一半。
PAIR 解决什么问题?
在本地跑多代理 AI,最让人头疼的就是显存不够用。一个 GPU 上同时要有好几个模型在调用,很容易就过载了。PAIR 的想法并不复杂:别让一台机器硬扛,而是把推理请求分给局域网里其他空闲的电脑。它支持 Ollama、LM Studio 这些常见的推理服务,接入现有代理框架的时候不用改代码。
工作原理:广度优先调度
PAIR 采用广度优先的任务分配策略。它会先扫一遍局域网里所有符合条件的节点,然后按顺序把请求分发出去。哪个节点能接,就让它接;任务只会跑到兼容的节点上,所以不会出现模型乱跑或者报错的情况。
- 支持 Windows 11、Linux 和 macOS,x64 和 arm64 都能跑。
- 可以把不同操作系统的节点混在同一个集群里用。
- 它不会合并 GPU,也不把多张卡的显存拼成一块;单个推理请求仍然由一台独立的系统处理。
实测表现如何?
NVIDIA 在演示中把 Hermes Desktop、Ollama 和 RTX Spark、DGX Spark、RTX 5090 组合在一起用。和单台 RTX Spark 相比,任务完成时间缩短了大概一半。不过官方也特别说了,这不算性能保证。实际效果还得看网络、模型大小和节点配置。
有用户拿三块 RTX 5090 跑 Qwen 3.8 27B,在重复负载场景下开了 PAIR,稳定性不错,GPU 也一直保持高占用。这种用法更适合“很多小请求并发”的场景,而不是单一大模型训练。
适合谁用?
如果你手头有多台本地电脑,又在跑多代理工作负载,PAIR 值得试试。代码已经挂在 GitHub 上了,入门指南也齐全。
要是想把不同人的 GPU 共享给很多人用,或者需要拆分超大模型,PAIR 就不太对口。官方建议看看 Petals、Mesh LLM 或 Skippy 这类方案。企业上云也行。找正规阿里云代理商,比如易枫顺 - 阿里云官方旗舰级代理商,拿到的阿里云优惠或阿里云代金券能直接抵扣云服务器ECS费用,省下的预算还能再添几台测试机。
FAQ
Q: PAIR 能合并多张 GPU 的显存吗?
A: 不能。PAIR 不会合并 GPU 或整合 VRAM,它把单个推理请求发给独立的可用节点。想拼显存跑超大模型,得找别的工具。
Q: PAIR 支持哪些推理服务?
A: 目前兼容 Ollama、LM Studio 这类本地推理服务,接入现有代理框架时不需要改动。
Q: PAIR 能把 Windows 和 Linux 电脑混在一起用吗?
A: 可以。PAIR 支持 Windows 11、Linux、macOS,x64 和 arm64 都行,不同操作系统的节点也能混在一组里。
Q: 在哪里下载 PAIR?
A: PAIR 已经发布测试版,可以从 GitHub 下载,带入门指南。如果想共享 GPU 或拆分超大模型,可以看看 Petals、Mesh LLM、Skippy。
关于易枫顺
深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺
来源:InfoQ