本周 Reddit 用户 RapidRaid 在 r/LocalLLaMA 发布 llama.cpp(目前本地跑大模型最主流的开源工具)的分支,把一项叫「DSpark PC Tree」的推测解码(speculative decoding,简单说就是让 AI 一次猜几个词,猜对就跳过、猜错再回头)技术落地了。在 RTX 5090 上跑 Qwen3 8B 模型时,生成速度从 94 tok/s 提到 159 tok/s,提速 65%-69%。论文标题里的「29.5%」是作者自加的,不准确;更稳的描述是「约 65% 提速」。
这是什么
普通推理是 AI 一次生成一个 token(可以理解为一个「字」)。推测解码的思路是先用一个小模型(小草稿)连猜几个 token,再让大模型一起验证——猜对了就白赚时间。PC Tree(Parent-conditioned drafting tree)是这套猜词策略的一种新写法,让草稿模型能根据父节点的语境做更准的预测。这次实验里,k3/n16 配置(猜测深度 3、每层分支 16)拿到了 159 tok/s,接受率 67.87%。
行业怎么看
社区的反应很冷静,主要质疑三点。第一,作者自己写了「first shot,没经过任何同行反馈」,属于孤证;第二,他测 27B Q4 量化版时效果反而变差,说明这项技术不是模型越大越好;第三,也是最关键的一点,在 SPEED-Bench 的 11 个场景里,总结类任务提升 +6.56%,但 RAG(让 AI 查资料再回答)和多语言任务反而略输线性方案(-0.5% 到 -1.4%)。换句话说,这不是「全面胜利」,而是「部分场景有效」。目前这个分支还没被官方 ggml-org 组织合并,停留在「一个极客玩具」的阶段。
对普通人的影响
对企业 IT:现阶段谈不上能上生产,IT 部门不需要为这件事做任何动作,等官方合并、再观察 1-2 个版本稳定度。
对个人职场:一般打工人感受不到直接影响,但反映出趋势——本地跑 8B 级别模型已经能在消费级显卡上跑到 150+ tok/s,比一年前快近一倍。
对消费市场:推理成本继续下降,会让 AI 应用订阅价、云端 API 调用费持续承压,长期对消费者是好事。