本周 Reddit 上一项针对 Qwen3.6-35B 的编程实测显示:5 个社区微调版本中只有 1 个能与原版持平——这款阿里通义千问推出的"游戏本能跑"的开源模型,正陷入社区"越改越差"的尴尬。
这是什么
Qwen3.6-35B-A3B 是阿里通义千问上线的"小钢炮"级模型:总参数 350 亿,但推理时只激活约 30 亿——技术上属于 MoE(混合专家架构,让模型内部"分组答题"以节省算力),显存占用接近 30 亿级别,普通游戏本即可运行。
测试者用 Aider Polyglot 编程评测工具对它和 5 个社区微调版本做横向对比。结果反直觉:原版一次性通过率 37.4%、重试后达 71%;5 个微调版里只有 Occamy-1.0 接近这个水平,其余全部落后。社区口碑不错的 Tiel 反而最差,重试通过率仅 53.3%。
行业怎么看
支持者的判断是:小规模微调并不总是"加法",反而可能损害原模型的通用能力。原厂的预训练数据规模和训练投入远超社区能调动的资源,盲目追求"为某个场景优化"往往得不偿失。
但反对声音同样存在。有人指出,本次评测只覆盖编程一项任务,无法推及写作、推理等场景;5 个样本量也偏小,难以得出"社区微调整体退步"的结论。还有开发者认为,提示词模板(即模型接收指令的格式)对成绩影响显著,换一套模板结果可能不同——这意味着测试结论的稳定性存疑。
对普通人的影响
对企业 IT:本地部署开源模型正变得可行,但"用原版还是微调版"已是真实选择题,采购和工程团队需要重新评估选型策略。
对个人职场:若打算用本地模型处理日常工作,目前最务实的路径是先用原版 Qwen3.6-35B 跑通流程,再判断是否值得针对特定任务做定制。
对消费市场:开源模型在小设备上跑得动这件事本身,正在压缩"必须联网调用云端 API"的必要性,未来个人 AI 工具的成本结构可能改变。