编辑部注意到这周 r/LocalLLaMA 上的一篇实验报告。一位独立工程师用一台普通游戏 PC — RTX 4070 Ti 显卡 + 32GB 内存 + 两块 NVMe 固态硬盘 — 硬扛 Moonshot AI 的 Kimi K3。
Kimi K3 有 2.8 万亿参数,模型文件 711GB,是目前公开的旗舰级 MoE 架构(MoE = Mixture of Experts,混合专家模型:每次推理只激活一小部分"专家"子网络)。但作者很诚实:"跑得起来"不等于"能用"。
这是什么
这是一个名为 CRANE V2 的自研推理引擎,专门解决"模型比显存大得多"的问题。核心思路不是把模型塞进显存,而是让它留在磁盘上、按需加载。
关键工程动作:把两块 SSD 视为一个逻辑存储池并行读取;按需加载精确的专家切片;用主机内存做缓冲,重叠存储与 GPU 传输;测试不同缓存替换策略。
三款模型结果:Kimi K3 标准速度 0.014 tok/s(每秒 0.014 个字),DeepSeek V4 Flash Q3(Q3 量化:参数精度压到 3 比特以减小体积)从 1.14 提到 8.08 tok/s,Qwen3.5-122B 标准 1.89 tok/s。
行业怎么看
支持者看到的是希望:大模型去中心化在技术上正在变得可能。对医疗、法律、金融这类数据敏感行业,把模型跑在本地、不出公司网络,是真实需求。
但我们要泼冷水。那些更漂亮的数字 — Kimi 9.3 tok/s、Qwen 57 tok/s — 是牺牲质量换来的:改路由策略、降精度、跳过共享专家层,结果输出变成多语言乱码,连"巴黎是法国首都"都答不对。作者把"速度墙实验"和"保质量实验"分开记账,目的就是不让数字被误读。
另一个被忽略的风险:711GB 存储对多数用户仍是天文数字。整套设备人民币万元以上,跑出来还是"每秒一两个字"。这不是消费品,是极客玩具。
对普通人的影响
对企业 IT:本地化部署 AI 的拐点临近,但"能跑"和"能商用"之间还隔着速度、稳定性、运维成本三道坎。除非有强合规要求,多数企业仍应优先用云服务。
对个人职场:未来 2-3 年,你的工作电脑也许能跑百亿参数以下的"小型版"大模型,完整版仍需云端 API。这对经常出差、需要离线工作的律师、咨询顾问、记者有实际意义。
对消费市场:DIY 玩家会先热闹起来,类似当年自建 NAS。普通消费者要等到 2027-2028 年才可能买到"插上就能用"的本地 AI 设备,前提是模型架构有根本性突破。