KV cacheLocalLLaMA
本地玩家发现提速诀窍:256k 长文本推理快 3 倍,但离商用还差几道坎
Reddit 上一位用户在小型模型上验证"分块缓存拼接"技巧,长文本 prefill 速度翻 3 倍且检索准确率未掉。这条帖子的真正价值是:本地长上下文推理的工程瓶颈,可能比想象中软。
Aug 22·2 分钟
QwenDeepSeek
Qwen 用户吐槽推理模型 50% 在说'等一下'——显存被思考烧光
Reddit 上一则玩笑戳中真实痛点:推理模型的思考链充斥填充词,KV cache(推理时的工作记忆)越吃越多,单卡能跑的请求数变少,部署成本正在失控。
Aug 18·2 分钟