本周 Reddit 上一帖把 Qwen3.8-27B 压到 Q1-Q2 极低精度(每参数只用 1-2 个比特表示)——能省内存,但作者自己说,关掉「思考模式」时模型几乎「答非所问」。
这是什么
27B 参数规模在「大模型」里算中量级,原本要在 24G 显存以上显卡才能舒服地跑。发帖人 jojohai 把模型做成 Q1-Q2 量化版本,并把 MTP(Multi-Token Prediction,多 token 预测——一种让模型一次猜多个字、提升推理速度的技术)直接拼进模型权重,避免外挂额外文件。他在 Vulkan(一种通用 GPU 计算接口)上验证:内存占用比外挂 MTP 文件明显下降。
直白讲:普通开发者笔记本离「本地跑一个像样的大模型」又近了一步。
行业怎么看
开源社区这边是兴奋的。Unsloth 官方一直没把 MTP 打包进最低量化版本,这次算是补上了拼图。
反对意见也得摆出来:这是个人项目,没跑基准测试,没有第三方复现,质量全靠作者主观判断——他自己也强调「不保证答案质量」。要走到企业能用的程度,至少还要过稳定性、可复现、合规审查几道关。类似极客实验每年冒出一堆,99% 卡在第二步,目前还不能当生产工具看。
对普通人的影响
对企业 IT:本地部署大模型的硬件门槛继续往下走,对不想把数据交给云端的传统企业是好事,但「能跑」和「能上线」仍是两码事,短期别因此做采购决策。
对个人职场:目前还属于极客玩具,离 Office 助手那种日常可用程度差得远,职场人不用为它调整工作流。
对消费市场:几乎无直接影响——这类实验距离装进手机或浏览器应用,至少还需要 1-2 年。