Reddit 用户这周在 r/LocalLLaMA 跑了一组对比测试,值得我们关心的是:本地跑大模型时谁更快,取决于模型能不能塞进显卡显存——塞得进时 llama.cpp 快 2-3 倍;塞不进时(如 63GB 的 gpt-oss-120b),32 人并发首 token 响应 FreeToken 19 秒,llama.cpp 要 139 秒,差距约 7 倍。
我们判断这不是简单的取代关系,而是同一问题两种解题思路:llama.cpp 把模型权重尽量压进显存;FreeToken 接受溢出,专心优化从内存到显存的 PCIe(显卡与主板间的数据传输通道)搬运。
这是什么
FreeToken 是一个较新的本地推理引擎,针对「模型权重 > 显存容量」的场景。它通过按需加载 MoE 模型(混合专家,即模型内部有多套参数,生成时只激活其中一部分)的部分参数到显存,缓解瓶颈。llama.cpp 是开源社区最成熟的推理引擎,长项是单卡高吞吐和宽硬件兼容。
本次测试硬件是一张 RTX 3090(24GB 显存)+ PCIe 3.0 主板,分别跑了 26GB 的 Gemma-4-26B-A4B(4-bit 量化,即把模型参数压缩到 4 位以节省空间)和 63GB 的 gpt-oss-120b。指标是首 token 响应时间(TTFT)和持续生成吞吐,并发量从 1 到 32。
行业怎么看
支持者认为,本地跑 120B 级大模型正从「理论可行」走向「工程实用」,对企业数据不出门、用得起本地 AI 是好消息。但三点保留意见值得注意:一、测试者明确说自己用的是 PCIe 3.0 主板,FreeToken 的 PCIe 链路已跑满上限,换 4.0 主板结果可能改变;二、测试只覆盖两个 MoE 模型,不能简单推广到稠密模型;三、FreeToken 0.1.2 还在早期版本,4-bit 专家场景下直接崩溃(OOM 即内存溢出),成熟度远不如 llama.cpp,贸然用于生产环境风险偏高。
我们的判断:开源推理引擎的竞争已从「能不能跑」进入「什么场景下跑得更好」的细分阶段。本地 AI 部署不再是「装一个软件搞定」,而是「按模型规模、并发量、硬件条件搭组合」。
对普通人的影响
企业 IT:考虑本地部署处理敏感数据(合同、内部文档、客户信息)时,需重新评估硬件采购——单卡 24GB 显存对 120B 模型已经不够,但 FreeToken 这类工具让「一张消费级显卡 + 大内存」方案有了工程意义。
个人职场:本地跑大模型从「极客玩具」更近一步,但暂未到「下载即用」阶段,尝鲜仍需熟悉命令行和量化参数。
消费市场:硬件需求正在分化——跑 7B 模型的笔记本和跑 120B 模型的台式机之间,配置差距越来越大,「AI PC」概念也会进一步细分。