这是什么
本周 Reddit 的 r/LocalLLaMA 板块(本地大模型玩家社区)出现一个高热帖:一个叫 Strata 的开源项目(https://github.com/Niko1221/Strata),用大约两周时间,在 MoE(Mixture of Experts,即"混合专家"架构,推理时只激活部分参数,Qwen、DeepSeek 等主流国产开源模型都走这个路线)的推理上,把事实标准 llama.cpp(让普通显卡也能跑大模型的核心开源工具)甩开一个量级。
具体数字:prefill(处理用户输入阶段)加速 5-10 倍,decode(模型逐字生成回答阶段)加速 3-4 倍。目标硬件是中端消费显卡(8-16GB 显存)加 64GB 内存,能跑到约 2000 token/s 的输入处理速度和 70 token/s 以上的输出速度。
值得关心的不只是速度本身,而是节奏——一个单人项目两周做到的优化,llama.cpp 维护团队拖了一年没动。
行业怎么看
支持方认为这是开源社区"少废话多做事"的胜利。MoE 缓存(即把已计算过的专家层结果暂存复用,避免重复计算)确实是推理优化的重要方向,arXiv 上早有大量论文证明可行,llama.cpp 仓库里也出现过相关 PR,但长期没合并。Strata 验证了一件事:当主线项目被保守路线卡住时,外部 fork(分支项目)完全可以跑得更快。
反对意见同样值得听。Reddit 单帖不等于可复现基准——发帖者本人承认 Strata 目前只针对 Qwen-3.8-flash-next 一个特定模型变体做了优化,泛化性尚未验证。llama.cpp 维护团队历来以"宁可慢一点也别崩"著称,他们的"缓慢"某种程度上是对几百万用户的稳定性承诺。还有一点容易被忽略:8-16GB 显卡加 64GB 内存,对真正的"普通用户"仍然是高端配置,"本地跑大模型"远没到人人可用的临界点。
更冷静的判断:Strata 的真正意义不在于它会取代 llama.cpp,而在于它释放了一个信号——本地大模型推理仍有大量优化空间,开源栈并非终局。
对普通人的影响
对企业 IT:本地化部署大模型的成本曲线被进一步压低,8GB 显存的工作站开始具备"跑得动且跑得快"的资格,私有化方案的中长期 ROI(投资回报比)值得重估。
对个人职场:会自己装环境跑开源模型的人,多了一个真正"快到可以日常用"的选项;不会装的人,暂时还不用关心这件事。
对消费市场:本地 AI 应用(写作助手、代码助手)真正"不卡"的临界点可能比预期早一两年到来,订阅制云端 AI 服务的护城河会继续被侵蚀。