一位开发者本周把 85GB 的 DeepSeek-V4-Flash 模型跑在 12GB 显存的 RTX 3060 上,速度约 3 token/s。表面上是技术宅实验,我们看到的判断是:本地大模型的成本墙正在松动,「AI 必须上云」这条默认假设开始动摇。
这是什么
普通游戏电脑的显卡只有 12GB 显存,传统做法装不下几十 GB 的大模型。开发者 Ivan Adriazola 的方案是:用 NVMe 固态硬盘当第四层「内存」(MoE 即混合专家架构,每次推理只激活一部分参数,所以硬盘读取量可控),配合 madvise(WILLNEED)(一种系统调用,告诉操作系统「这块数据马上要用,请提前加载」)让 Linux 把多层专家参数并行读进内存。结果:同等硬件下,模型从硬盘加载专家的速度比裸跑 llama.cpp(主流开源推理引擎)快约 4 倍。
行业怎么看
乐观声音认为这是 MoE 模型的「本命优化方向」——大模型实验室都跑去堆 H100 集群,但本地社区在做另一条路:让消费级硬件也能跑得动。
我们更想提醒三处风险。第一,3 token/s 对话体验仍然偏慢,AI 一次性回复要等十几秒。第二,冷启动(即首次加载模型)102 秒,每次换对话都要等;这是「工程实验」而非产品。第三,单机、单模型、单开发者自测,未经过社区验证,作者自己也说「vibecoding」(凭感觉写代码)成分高,结论不应外推。
对普通人的影响
对企业 IT:若方案被复现,敏感数据本地跑大模型的成本会显著下降,数据合规场景多一个选项。
对个人职场:现在仍是极客玩具,不是生产力工具,但信号值得留意——大模型本地化的成本曲线已经开始弯曲。
对消费市场:如果「本地 AI」形成趋势,显卡和大容量 NVMe 固态可能再次成为抢手硬件。