本周本地 AI 圈出现一个小分流:Freetoken 这类工具开始支持 MoE 卸载(offload,即把模型分层放在 GPU 和内存),让一张 24GB 显存的消费级显卡也能尝试跑 70B 参数级别的大模型,而以前这基本要 48GB 显存起步。
这是什么
MoE(混合专家架构,把一个大模型拆成多个「专家子网络」,每次推理只激活一部分)是大模型这两年降本的核心技术之一。Freetoken 是一个较新的本地推理工具,本周在 Reddit 的 LocalLLaMA 社区被讨论,原因是它开始支持 MoE 模型的卸载——当显存装不下整个模型时,把溢出的层放到内存甚至硬盘。社区用户在拿它和 llama.cpp(目前最主流的本地推理引擎)做对比。简单说,本地跑大模型的门槛,正在被一点点往下挪。
行业怎么看
乐观的一方认为这是「算力平民化」的延续:更多人不用依赖云厂商就能在自己电脑上跑大模型,隐私和成本都更友好。谨慎的一方则指出,offload 之后推理速度会显著下降(通常只有 5-10 tokens/秒),「能跑」和「好用」是两回事;而且 MoE 模型在量化(把精度从 FP16 压到 INT4 等低精度以省空间)后的质量损失本身就一直有争议。这类工具只是把门槛往下挪了一格,没有解决硬件成本的根问题。
对普通人的影响
- 对企业 IT:短期内不必上心,本地跑大模型目前仍是开发者社区的事,没到生产环境可用阶段。
- 对个人职场:技术岗知道这条线在演进即可;非技术岗可以忽略,本周不会有任何体感差异。
- 对消费市场:暂无直接影响。普通人接触 AI 仍然以云端 API 和 SaaS 工具为主,这条信号更多是技术圈内部的事情。