这是什么
本周值得记住的数字:165。一位 Reddit 用户在自家 PC(两块 RTX 3090 + 普通 NVMe 固态硬盘)上跑出 27B 参数的 Qwen 模型(INT4 量化版,把模型精度从 16-bit 压到 4-bit 省显存),Agent 类任务实测 165 token/秒。这速度意味着消费级硬件第一次"接得住 Agent 任务",不是"能跑就不错"。
三个技术让这事成立:INT4 量化让 27B 模型塞得进两张 3090 的 48GB 显存;投机解码(speculative decoding)让小模型先猜词、大模型批量验证,速度提升 2.4 倍;LMCache(一种推理缓存系统)把对话历史扔进 54GB 内存和 1.5TB SSD 形成 18M token 的"记忆池",下次直接复用不重算。
整机二手不到两万人民币。
行业怎么看
开源阵营(DeepSeek、Qwen、Llama)走"小模型 + 推理优化"路线,这条帖子是一次里程碑式证明。但值得警惕的是:这是单点工程优化演示,复现门槛极高——需要给 vLLM(开源推理引擎)0.28.0 打两个 PR 补丁、特定 LMCache 版本、特定 SSD 型号,普通用户照搬大概率跑不起来。
更冷静的看法:27B 本地模型和云端 200B+ 旗舰的智能差距没缩小,"跑得动"不等于"用得好"。企业生产环境还要稳定性、并发和合规,消费级硬件的功耗和故障率撑不住 7×24 运行。
对普通人的影响
对企业 IT:自建 AI 的硬件门槛在松动,但"能跑通 demo"和"能扛住生产"之间还有 1-2 年距离。
对个人职场:技术爱好者和小团队可本地跑大模型试水,省掉每月几千的 API 费用,但需要较强工程能力。
对消费市场:这是"大模型上个人设备"的早期信号,真正的消费级易用产品(笔记本、手机、车机本地大模型)还要 12-24 个月才成熟。