本周 Reddit r/LocalLLaMA 上一个帖子引起我们注意:用户 hellohazime 把 Moonshot 的 Kimi K3 模型砍掉多语言部分,体积从 711GB 压到 478GB——只保留英语,智能几乎没有损失。更有意思的是,一个 478GB 的 2-bit(每个权重只用 2 个二进制位表示)变体在 SWE-Lancer 编程测试上「疑似」超过了此前的 2-bit 版本。

这是什么

Kimi K3 是 Moonshot(一家中国大模型公司)的千亿参数级别开源模型,原本需要接近 1TB 硬盘空间才能本地运行。「Unsloth」是一个社区开发的低显存推理项目;「IQ2-XXS」是一种极低精度量化格式(把模型权重从高精度数字压缩成 2 个二进制位)。这次操作的本质是:用激进压缩换可用性,把消费级硬件门槛往下踩。同时也意味着中文、日文等多语言能力被切除——本地玩家用英文跑任务可以,但中文用户想本地用就要掂量。

行业怎么看

支持方认为这是开源社区的力量展示:模型公司发权重,民间做裁剪,组合出大厂自己没规划的轻量版本。有人已经在畅想 Qwen MAX、DeepSeek V4 Flash 用同样思路能砍多少。

质疑声音同样值得记录。原帖作者自己的测试显示,完整的 2-bit 版本反而跑失败,而裁剪后的版本成功了——这可能是环境差异,也可能是砍掉的某些权重(帖子里的「expert 层」)意外包含了噪声而非能力。换句话说,「更小一定更好」并不成立,盲目裁剪有翻车风险。要严谨对比需要租云端 GPU(图形处理器,算力最强的芯片),跑一轮 SWE-Lancer 的成本约 1800 美元。

对普通人的影响

对企业 IT:如果某些场景只需要英文处理(比如代码生成、英文文档分析),478GB 这个量级意味着 4-6 块消费级 SSD(固态硬盘)就能搭一台本地推理服务器,不必租用云端。

对个人职场:技术从业者可以本地跑接近旗舰的开源模型做实验,只是中文能力是短板;对中文任务敏感的人不适合。

对消费市场:现在判断「人人本地跑千亿模型」还早——478GB 不是普通笔记本能装的。但方向是清晰的:硬件门槛每隔几个月就被踩低一档。