一位 Reddit 用户花了三周时间,用一台 RTX PRO 6000 工作站(96GB 显存)压测国产开源模型 Qwen3.8 的三个版本。结果里最值得关心的一行:27B 稠密模型在「Battle Arena」综合打分中拿到 700/1000,超过 Claude(678)和 GPT(473)。同期参与测试的还有 Flash-Next(MoE 架构),它在需要长链条推理的任务上更强。
技术细节按下不表,但有两个数字对企业 IT 选型有参考价值:一是 DFlash2 推测解码(一种让小模型先猜、大模型复核以提升速度的加速技术)把 27B 推理速度从 75 tok/s 提到 210 tok/s,提升 2.8 倍;二是三个模型在 26 万 token 长上下文(模型一次能读多长文本)的「大海捞针」测试中召回率都达到 100%。
这是什么
这是一位独立测试者在 r/LocalLLaMA 社区发布的本地部署评测,覆盖 Qwen3.8 家族的 27B 稠密版、Flash-Next MoE(混合专家,即把大模型拆成多块、按需激活以省算力的架构)版,以及一个去审查微调版本。测试在 SGLang 和 vLLM 两种推理引擎(让模型跑得更快、更稳的开源服务框架)上跑,含速度、工具调用、视觉任务、长上下文等 10 项任务。需要说在前面的测试纪律——这是单人测试,不是 Meta 或第三方机构的正式基准报告。
行业怎么看
支持派会把这解读成「开源已经追上闭源」的证据——27B 参数(不到顶级闭源模型传闻规模的 1/10)能在某些任务上跑赢,确实是结构性变化。但编辑部注意到三个保留意见:第一,Battle Arena 是社区风格的综合打分,不是代码、数学、事实性等单一硬基准,闭源模型在企业真正用得到的任务上仍有领先;第二,跑得起来和跑得好之间有距离——单张 RTX PRO 6000 工作站整机价格约 8–10 万元人民币,对中小企业不是小数目;第三,本地部署需要运维、推理优化、模型微调能力,绝大多数企业目前不具备。
对普通人的影响
对企业 IT:如果你们公司在评估私有化部署(把模型装在自己机房或服务器上),这个案例是新的锚点——27B 量级的开源模型已经值得纳入对比清单,而不是默认「必须用闭源 API」。
对个人职场:直接相关性低。除非你是开发者或数据科学家,否则「本地能跑 27B」这件事不会改变你的工作流。
对消费市场:工作站级 GPU 和高显存整机可能更频繁地出现在企业采购清单上;面向开发者的「AI 一体机」类产品有空间,但消费级 PC 还远没到能本地跑这种模型的程度。