推理模型
找到 10 篇关于此标签的文章
Qwen 3.8 实测:深度思考模式多烧 5.5 倍 token,本地部署账该重算
一位 Reddit 用户在 MacBook Pro M5 Max 上跑了 Qwen3.8-27B:开启「深度思考」模式后,token 消耗是普通模式的 5.5 倍、推理耗时 6 倍;关闭后质量又掉到其他 MoE 模型之后。开源模型「会思考」与「想得起」之间的成本裂缝正在浮出水面。
Qwen 把思考深度做成可调档位 — 阿里让大模型开始按需分配算力
阿里通义千问被开发者社区热议的「可调思考深度」功能,意味着用户可以让模型简单问题秒答、复杂问题多推理。这是大模型从「开关」走向「旋钮」的一步。
IBM 一次放出三个推理大模型,开源免费商用 — 老牌 IT 巨头这回动了真格
IBM 本周在 Hugging Face 一次性发布 Granite 4.2 系列三个推理模型(30B/8B/3B),全部采用 Apache 2.0 协议,免费可商用。支持思维链推理、思考强度切换、512K 长上下文。意味着传统 IT 厂商在 AI 时代开始正面迎战开源阵营。
Qwen 用户吐槽推理模型 50% 在说'等一下'——显存被思考烧光
Reddit 上一则玩笑戳中真实痛点:推理模型的思考链充斥填充词,KV cache(推理时的工作记忆)越吃越多,单卡能跑的请求数变少,部署成本正在失控。
Qwen 新模型思考 90 分钟不出答案 — 一个参数治好开源 AI 的「想太多」病
阿里开源的 Qwen3.8-27b 模型有个怪毛病:默认会陷入「过度思考」,单次推理能跑 90 分钟不出结果。本周 Reddit 上一位开发者分享两个 llamacpp 参数把这个问题治住。这件事值得关心,是因为它揭示了开源推理模型正从「跑得动」走向「跑得顺」的实用化跨越。
中国团队把 Ling 3.0 合并进 llama.cpp — 1B 激活参数就能本地做复杂推理
Inclusion AI 的 Ling 3.0 系列本周合并进 llama.cpp,让开发者用消费级硬件就能本地部署。最让我们意外的:tiny 版本激活参数仅 10 亿,却被标注为推理模型——能做多步思考。意义:中国开源在推理能力上正以更小参数逼近闭源前沿。
强化学习只改 1-3% 输出 — 推理模型训练开销可能虚高千倍
本周一篇被热议的论文指出,强化学习(RL)对推理模型输出只做 1-3% 的改动;不用 RL 也能复现推理能力,计算成本却低约 1000 倍。对所有正在烧钱训推理模型的公司,这是一次直接拷问。
Qwen3 被吐槽过度思考 — 推理模型的「思考链」正在变成累赘
阿里 Qwen3 的开源版本在海外本地部署社区遭遇集中差评:模型花大量时间「思考」和做用户没要求的事,真正干活前上下文(模型一次对话能记住的信息量)就被吃光。这反映的是推理类模型的通病,不只是 Qwen3 一家。
Reddit 用户给开源 27B 模型手搓"省力档",推理开销砍到五分之一
本周 r/LocalLLaMA 上一个技术帖引发小范围讨论:开源 27B 推理模型缺一个真正可用的中等档位,一位用户通过改对话模板,把"低"和"最高"两档提示词混在一起,手搓出新档。质量接近最高档,但模型"思考"的文本量只有原来五分之一。这对本地部署的成本账本是一次值得记的更新。
Qwen3.8 本地实测:调一档推理强度,思考 token 从 2 千飙到 4 万 — 隐性成本
本地开发者测试阿里新模型 Qwen3.8-27B,发现 reasoning_effort 参数对输出 token 量影响巨大(2 千 vs 4 万,差 20 倍)。这意味着推理模型时代,'思考成本'是被低估的部署变量,企业选型时不能只看 API 单价。