本周 r/LocalLLaMA 上一篇帖子引起我们注意:用户 MD_Reptile 用三张 RTX 3060 12GB(旧矿卡,二手市场千元级)组了一台本地 AI 推理机(让模型在你自己的电脑上现场生成文字,而不是调用云端 API),跑一个叫 Flash Next 的推理引擎,速度达到 38-40 token/秒。
对比基线是 llama.cpp——目前本地跑大模型最主流的开源工具,同硬件下只有 13.2 token/秒。差距接近三倍。关键在于 Flash Next 用的 strata 低比特量化(把模型参数压缩到极低精度以省显存,IQ3 意味着每个参数只用约 3 bit),相当于在 3060 的 12GB 显存里塞进更大的模型,还跑得更快。
这是什么
简单说就是:旧矿卡 + 新推理引擎,让一台三千块级别的机器跑出接近云端小模型的速度。token/秒是衡量大模型生成速度的常用单位,40 t/s 大致是人类阅读速度的 1.5 倍,对话体验已经很流畅。
这件事之所以值得关心,是因为本地推理一直卡在两个问题上:硬件贵、速度慢。如果三张旧卡就能解决,硬件门槛和电费成本会同步下降。
行业怎么看
本地推理社区的反应是兴奋但审慎。一派认为这是真正的拐点——当三张几百块的二手卡能跑出接近云端小模型的速度,企业自建 AI 推理的硬件成本会骤降,敏感数据不出内网的诉求也更易满足。云端推理 API 的定价压力也会随之而来。
反对意见同样具体:第一,这是单点测试,没有跑完整 benchmark(标准性能测试套件);第二,3060 的 12GB 显存对真正能用的模型仍然偏窄,复杂任务容易爆显存;第三,Flash Next 还是相对小众的工具,长期维护和稳定性未知。换句话说,硬件便宜了不等于现在就能替代云端。
对普通人的影响
对企业 IT:如果未来一年本地推理价格曲线继续下行,部分中等规模企业的私有化部署方案(数据不出公司内网的 AI 系统)会重新变得划算,值得让供应商给出新报价。
对个人职场:现在折腾本地大模型仍然是工程师和硬核玩家的游戏。但一年内,「在自己笔记本上跑一个可用的 AI 助手」可能变成普通职场人也能做到的事。
对消费市场:二手 3060 矿卡本来就在显卡市场里滞销,这个趋势可能让它们从「矿渣」变成「AI 入门卡」。近期有装机或升级打算的读者可以留意价格。