本周我们注意到 Reddit LocalLLaMA 社区一份跑分报告反直觉:用 4 张 RTX 3090 跑阿里 Qwen3.8 27B 开源大模型,性能比只用 2 张慢 33% 到 41%,差距随并发量(同时处理的请求数)扩大。

这是什么

测试者用 4 张消费级显卡部署 Qwen3.8 27B,每张 24GB 显存。RTX 3090 是英伟达 2020 年的旗舰,二手市场至今仍是中小企业本地跑大模型的主力配置。

关键发现:当 4 张卡协同推理(即"张量并行 4 路",术语 TP=4,让多张卡共同计算同一层)时,跨卡通信拖了后腿。这套机器里两两显卡之间用 NVLink 直连(一种显卡间的高速专线),但两对之间只能走 PCIe(主板标准插槽,速度慢很多)。每生成一个 token(AI 处理文字的最小单位,一个汉字约 1-2 个 token),模型每一层都要在两对卡之间做一次数据同步,开销随并发量放大。

实测数据:从并发 12 个请求起,TP=2(只用 2 张卡的一对)跑出 428-587 token/秒,比 TP=4 的 320-418 token/秒明显更快。同时跑两套 TP=2 实例,总吞吐达 1175 token/秒。

另外两个发现值得留意:模型自带的 MTP,即"猜测多个 token 再验证"的提速技巧,在 3090 上反而拖慢 27-42%;提示词处理(模型"读题"阶段)是单线程瓶颈,并发再多请求也排着队等。

行业怎么看

我们认为,这份跑分直接挑战了"卡越多越快"的硬件军备竞赛逻辑。对想自建大模型的企业 IT 部门是个提醒:堆卡之前,先用 nvidia-smi topo -m 命令看清卡间物理拓扑,别按供应商话术配机器。

但反对意见同样成立:测试硬件是 Ampere 架构(英伟达 2020 年 GPU 微架构)的 3090,最新 Hopper、Blackwell 架构已通过 NVLink Switch 把所有卡全互联,跨卡通信不再是瓶颈。MTP 加速在 3090 上吃亏,官方数据显示在 H100、H200 上有正向收益。换句话说,这份结论的适用范围有限,不能简单推广到云端或新硬件。

另一个值得关注的信号:开源大模型越来越值得被认真跑分。Qwen3.8 是阿里通义团队的主力开源模型,能被社区拿消费级硬件反复折腾,本身就说明中国大模型在工程成熟度上已经能跟 Llama、DeepSeek 同台比较。

对普通人的影响

对企业 IT:采购 AI 服务器前先做小规模基准测试,跑分比供应商 PPT 可靠。"卡数翻倍性能翻倍"是错觉。

对个人职场:懂硬件拓扑、模型量化(用更低精度压缩模型体积)、推理框架的复合型工程师会更值钱,纯调 API 的岗位会被工具替代。

对消费市场:阿里把 27B 模型做到消费级显卡能跑,意味着未来手机和笔记本里的本地 AI 会更强,云端 AI 订阅费不会一直涨。