这是什么
本周 Reddit 上一位用户把消费级显卡跑 AI 的速度从每秒 17 个字拉到 53 个字 — 接近三倍,而硬件没动。
他用的是 Strata —— 一种让大模型在本地跑起来的底层推理引擎,属于开源社区最流行的 llama.cpp 的衍生分支。硬件配置并不豪华:英伟达 5070 Ti 16GB 显卡 + 英特尔 14700KF CPU + 96GB 内存。模型是阿里通义千问的小尺寸版本,上下文窗口(AI 一次能「看见」多少字)做到 25.6 万字,相当于一次性塞进整本小说或完整代码仓库。技术上能把这么长的上下文塞进 16GB 显存,靠的是把 AI 的「短期记忆」(KV 缓存)放在内存里、只把当下用到的 32K 滑窗喂给显卡。
提速靠三件事:跑了一次内置的「自动校准」工具,让引擎针对英特尔混合架构(大核小核分工的 CPU 设计)重新分配线程;调深「推测解码」窗口(让 AI 先猜一串字、猜对了就跳过计算);关闭 PCIe 总线复制改为就地计算。三者叠加,速度翻了三倍。
行业怎么看
值得乐观的判断:本地大模型的「软件侧优化」正在快速追赶硬件。一位社区用户的周末折腾顶得上一块新显卡,这说明开源生态的迭代速度被低估了。对开发者和极客来说,「在家跑能用的 AI」已从愿景变成事实。
但我们也要看到反面:这位用户指出,默认参数是为 AMD 6 核 CPU 调的 — 英特尔混合架构的用户长期跑在次优配置上,没人主动修。这意味着普通白领想「装上就用」还差得远,调优这套东西依然需要相当的技术判断力。本地 AI 的民主化是真实的,也是参差不齐的。
对普通人的影响
对消费市场:本地 AI 正在跨过「能用」的门槛。两年前家用显卡跑不动的小模型,现在 16GB 显存就能流畅跑。但「能用」和「开箱即用」之间还有不小距离。
对个人职场:如果你担心公司敏感数据上传云端被泄露,本地部署正在变成真实选项。但现实是,普通白领想自己折腾起来还有技术门槛。
对企业 IT:采购清单上可以开始出现「本地推理服务器」这一项。25.6 万上下文意味着可以一次喂进整份合同或整个代码仓库做分析 — 但运维成本和懂行的人才,目前仍是真问题。