找到 1 篇关于此标签的文章
本周 Reddit 用户 jojohai 把 Qwen3.8-27B 模型做成 Q1-Q2 极低精度版本,并把多 token 预测能力直接嫁接进权重。结论:内存占用比外挂方式更低,但关掉「思考模式」时模型「非常笨」,目前只是社区玩具。