开源推理工具 AirLLM 这周更新,号称把 671B 的 DeepSeek-V3 跑在 12GB 显卡、2.8 万亿参数的 Kimi K3 跑进 4GB 显存——数字很性感,但先别激动。
这是什么
AirLLM 不是新模型,而是给已有大模型做的「省显存」推理引擎。核心思路是流式加载:不需要把整层塞进显存,用到才读。对 MoE(混合专家,即模型内部按需调用多个子网络)架构尤其友好,因为每次推理只激活少数专家。本次新增对 Qwen3.8-27B 和 Kimi K3 的支持。
行业怎么看
支持方视其为「本地部署超大模型」的破局点,认为中小企业不必再买 A100 集群。但反对声音同样有力:流式加载意味着每个 token 都要读硬盘,推理速度远低于常规部署;2.8 万亿参数 Kimi K3 这种说法在社区仍有质疑;不同模型架构适配成本高,可稳定复现的案例有限。
对普通人的影响
对企业 IT:短期别当降本方案,速度和稳定性都未过关。
对个人职场:技术爱好者可拿来尝鲜,工作流里用它还早。
对消费市场:方向比结果重要——本地 AI 跑在消费级硬件上,正在从口号变工程现实。