Reddit 上一位开发者拿 4 张 RTX 5060Ti(消费级显卡,单卡 16GB)跑 Qwen3 大模型,启用一项名为 PCI-E P2P(点对点直连,让多张显卡绕过 CPU 直接互相传数据)的功能后,预填充速度(可以理解为「读题速度」)从约 1649 tokens/秒提升到约 2305 tokens/秒,相当于免费拿到 25% 的性能提升,且无需更换任何硬件。
这是什么
P2P 全称 Peer-to-Peer,指让多块 GPU 直接通过 PCI-E 总线互相传数据,绕过 CPU 和系统内存。在企业级计算卡(如 NVIDIA A100、H100)上这是默认能力,但在消费级显卡上长期被驱动锁死,因为 NVIDIA(英伟达,全球最大 GPU 公司)靠这一刀划分专业与消费市场。
这次开发者用的是社区修改版驱动加 ReBAR(PCI-E 的一项底层规格,让 CPU 与 GPU 能更高效交换数据),4 张 5060Ti 总显存 64GB,跑 Qwen3-27B-FP8(一个 270 亿参数的开源大模型,FP8 是低精度压缩格式,能让模型用更少显存运行)。换句话说:用约两万块人民币的消费卡,跑出了一个原本要专业卡才能达到的水平。
行业怎么看
社区里多数人在传这份数据,把它视作「穷人的 H100」方案。也有人提醒:25% 是预填充场景的提升,文本生成速度(模型「打字」速度)变化不大,且长上下文下收益会被显存带宽限制吃掉。更稳妥的判断是——单卡体验没变,多卡协同的门槛才真正降了一级。
也有质疑声音:驱动修改绕过了 NVIDIA 的官方支持,一旦驱动更新可能失效;对 8x 模式(PCI-E 通道减半,常见于插了多卡的主板)的稳定性,作者也承认「还在摸索」。所以这次是阶段性成绩,不是稳态结论。
对普通人的影响
对企业 IT:如果你的公司对数据合规要求高、必须本地部署大模型,过去至少要买专业卡或服务器,现在用消费级集群加这个方案,采购成本可能砍掉一半以上,值得评估。
对个人职场:如果你正在学 AI、想自己跑模型而不是只调 API(调用云端现成接口),8GB 显存笔记本的体验天花板有限,但一台装 2-4 张中端卡的小主机,正在变成一个新的「够用起点」。
对消费市场:这件事对游戏玩家几乎无感,但会强化「显卡不只是游戏配件」的认知,也意味着 NVIDIA 的产品分层策略正被社区一点一点撬开。