一个叫 FreeToken 的开源项目最近在 Reddit 本地大模型社区引发关注:用户用 16GB 显存的 RTX 5080 消费级显卡,跑出 Qwen3 系列 35B 模型约 110 token/s 的推理速度,模型体积约 20GB,靠显存与内存协同承载。

这是什么

FreeToken 由 FlashML 团队开源。本地推理(在自己设备上跑 AI 模型,不调用云端 API)这件事并不新鲜——llama.cpp、vLLM、MLX 等工具一直在做,但传统方案要么需要 A100/H100 这种专业卡,要么在小显存设备上速度很慢。

这个项目的特别之处:针对 NVFP4(英伟达 4-bit 量化格式)和内存卸载做了优化,让 16GB 显存的消费级显卡也能跑出三位数 token/s。过去需要按 token 给 OpenAI 付费的对话速度,现在可能用一台普通游戏主机就能达到。

行业怎么看

支持者认为这是本地 AI 的分水岭时刻:如果数据可复现,对数据敏感行业(医疗、法律、咨询)尤其有价值——客户数据不必再交给云端。

但我们建议保持冷静:这是 Reddit 用户的单点测试,没有第三方独立复现;NVFP4 是英伟达私有格式,AMD 和英特尔显卡跑不了;35B-A3B 这个模型命名也让人疑惑(A3B 通常指 MoE 混合专家架构,活跃参数远小于 35B,速度快并不意外)。判断"成本故事改写"还为时过早。

对普通人的影响

对企业 IT:短期不建议替换生产环境的云端 API,但可以小规模试点,把内部非敏感的 AI 工作流迁回本地。

对个人职场:律师、会计、咨询等数据敏感行业的从业者,本地处理客户资料的可行性正在变高,值得持续关注。

对消费市场:消费级显卡厂商和 AI PC 厂商(联想、华硕)可能拿这类工具做营销点,"能跑大模型的笔记本"会成为新品类。