31 胜 3 平 0 负——一个叫 AaryanKapoor 的本科生,租 4090 显卡把阿里 Qwen3.5-9B 重新压了一遍,击败六家做了几年的成熟模型压缩团队。这意味着开源社区的"单兵"开始系统性反超成熟团队,而量化方法、压缩标准这些"基建设施"的定义权,也在悄悄离开中国。
这是什么
模型"量化"(quantization)是把大模型压缩成更小文件,让普通显卡、笔记本也能跑。Qwen3.5-9B 是阿里开源的 90 亿参数中等模型。
他在 34 组大小匹配对比中击败了 Unsloth、Bartowski、LM Studio、mradermacher、byteshape、AtomicChat 六家主流团队,31 胜 3 平 0 负。Q4_K_XL 中等压缩档比 Unsloth 同档在 KLD 指标(衡量压缩损耗,越低越好)上好 23%,文件还更小;旗舰版本在 MMLU、HumanEval+、MBPP+ 主流测试上与不压缩的 BF16 原版"统计上无法区分"。
行业怎么看
兴奋点明显:Unsloth、Bartowski 都是做了好几年的成熟项目,却被单一本科生追上。Aaryan 也透露 27B 量化已在路上。
但要冷静三件事。
第一,这是 Qwen 9B 一个模型,核心指标是 KLD(衡量分布差异),不是真实业务效果。"测试分数接近"和"实际场景一样好用"中间还隔着工程实现。
第二"本科生租 4090"很浪漫但不持久。他自己也在找实习,节奏取决于算力预算;开源社区长期靠兴趣驱动,质量容易波动。
第三,更宏观的视角:为什么是国外学生在帮阿里 Qwen 做优化?背后是中国开源大模型被全球社区改造——是好事,但也意味着量化方法、压缩标准这些"基建设施"的定义权不在中国手里。
对普通人的影响
对企业的 IT:9B 模型压缩到接近无损,意味着消费级 4090 显卡可以跑出接近完整的智能水平,企业自建私有 AI 的门槛在肉眼可见地降低。
对个人职场:本地 AI 工具"跑得动"和"跑得好"之间的差距正在快速缩小。关注 AI 工具的产品经理,可能已能在自己笔记本上跑出过去只有云端 API 才能给出的回复质量。
对消费市场:这件事短期不会到消费者桌面。但它是更便宜、更可用的终端 AI 的早期信号——手机、车机、离线 AI 的体验天花板,正在被这些开源工作一点点抬高。