这是什么

这周 Reddit 用户 rmonsurate 在 r/LocalLLaMA 发布两个基于 Qwen 的开源微调模型:

Victoria,主打编程和 Agent(能自主执行多步任务的 AI)。核心技术是用一种叫 REAP 的剪枝方法(pruning,即删除模型中不重要的部分),把 MoE 架构(Mixture of Experts,混合专家——把任务分给不同"专家子网络"处理)里的专家模块从每层 512 个砍到 288 个,相当于砍掉 44%。砍完后不是简单压一压参数,而是直接用 4 位浮点(NVFP4,一种低精度但保留训练过程的数字格式)从头重训。结果 Terminal-Bench 2.1(编程 Agent 基准测试)跑出 70%,比未剪枝版本 62.5% 还高。

Maple,专门回答加拿大本地问题(税务、福利、法规)。基础模型默认按美国回答,引用加拿大官方资料的比例只有 6%;微调后升到 62.9%,"完全答对"的比例从 6.6% 升到 21.8%。

两个模型权重都开源,可在 Hugging Face 下载;Victoria 的 GGUF(一种本地推理常用格式)版本约 49GB。

行业怎么看

我们注意到,这两条发布呼应了开源社区近半年的趋势:不再比谁参数大,开始比谁跑得起、用得起。

正面声音认为,REAP 剪枝 + 4 位训练证明了一件事——开源模型不再需要堆顶级硬件,单台工作站也能跑出像样的编程 Agent。这对不能把数据送云的企业尤其有意义。

但也有谨慎看法:70% 的跑分作者自己都标注是"单次测试、可能不稳定";Maple 的评分只用了 AI 评分器,没经过人工核查;而且 GGUF 版本和主流 llama.cpp(最常用的本地推理工具)还不兼容,得用作者的分支版才能跑。这意味着离"开箱即用"还有距离,本质上还是研究者自用阶段,离企业级部署差几步。

对普通人的影响

对企业 IT:开源模型能在自家服务器上跑编程 Agent,过去是"理论上可以",现在是"有人跑出来了"——数据合规敏感的行业可以开始认真评估本地化方案。

对个人职场:本地 AI 编程工具的硬件门槛在降低,未来不一定要每月付海外订阅费,单台高配工作站就能撑起日常使用。

对消费市场:Maple 这种"为某地/某行业定制"的模式,预示 AI 产品会越来越像"本地化插件"——比如专门服务中国税务、欧盟法规、地方补贴政策的模型——而不是一个通用助手打天下。