93.8% 的提示词直接从磁盘缓存返回、GPU 只重算 4.9 万个 token,这个结果说明:本地大模型的新门槛,已经不是“能不能跑”,而是“能不能把贵的算力少用几次”。一位开发者在 r/LocalLLaMA 公开了自己的实验:在 96GB 内存的 Mac Studio 上,通过改造 qMLX,引入更激进的冷缓存策略,尝试让 Qwen3.5 122B 支撑 3 个并发会话。
这是什么
这不是模型能力突破,而是推理工程优化。作者把 KV cache(模型处理长上下文时保存的中间记忆)更多放到 SSD 上,减少 GPU 重复“预填充”计算;再配合更好的淘汰策略,让多个会话看起来同时在线,但底层仍尽量串行处理。作者把它概括为“并发而非并行”:用户能同时开多个对话,机器却不必真的为每个对话都付出一整份算力。
这件事值得关心,因为它击中了本地部署最现实的一笔账:硬件买不起更大的,就只能把调度、缓存和存储榨干。
行业怎么看
我们注意到,这条路径和云厂商拼更大集群不是一回事。它更像是在回答一个中小团队真正关心的问题:现有设备能不能多带几路 Agent(能调用工具、拆分任务的自动化系统)或内部助手,而不把成本打穿。对做私有化部署、数据不愿上云的企业,这类优化比“再发一个更大的模型”更有现实意义。
但反对意见也很明确:第一,这还是开发者自建方案,不是开箱即用产品;第二,SSD 冷缓存会换来延迟波动,适合后台任务,未必适合强实时交互;第三,样本目前只覆盖特定硬件和 20 分钟测试,离企业级稳定性还有距离。换句话说,它证明了方向,不等于证明了成熟度。
对普通人的影响
对企业 IT:私有化大模型项目的采购逻辑可能变化。与其一开始追求更贵显卡,不如先看缓存、调度和多会话利用率。
对个人职场:本地 Agent 的可行性在上升,知识库、文档助手、代码副手这类工具,未来更可能在办公室电脑旁边直接运行,而不是全靠云端。
对消费市场:高配 Mac、工作站和带大内存的终端,卖点会从“创作性能”逐步延伸到“本地 AI 承载能力”。硬件厂商和软件厂商都会重新包装这件事。