返回首页
推理优化
找到 6 篇关于此标签的文章
DeepSeek投机解码
开源大模型现在会'预判'下一句了 — 投机解码正在变成推理标配
最近有用户在本地显卡上跑开源大模型时,肉眼看到投机解码在工作——AI 提前猜出'美利坚合众国'这类高频短语,瞬间整句输出。背后是 MTP 多 token 预测技术。我们关心的是:本地推理的成本曲线正在被悄悄改写。
13h ago2 分钟
QwenRTX 3090
两块 3090 显卡跑 27B 大模型,每秒 165 字 — 本地 AI 第一次"够用"
我们注意到一位 Reddit 用户在两块 RTX 3090 游戏显卡(整机二手不到两万)上跑出 27B Qwen 模型每秒 165 字,达到接 Agent 任务的水准。本地大模型第一次从"只能玩"跨进"能干活"。
1d ago2 分钟
KV cacheLocalLLaMA
本地玩家发现提速诀窍:256k 长文本推理快 3 倍,但离商用还差几道坎
Reddit 上一位用户在小型模型上验证"分块缓存拼接"技巧,长文本 prefill 速度翻 3 倍且检索准确率未掉。这条帖子的真正价值是:本地长上下文推理的工程瓶颈,可能比想象中软。
Aug 222 分钟
AntLingLing-3.0-flash
国产大模型开始卷推理成本 — 但省钱这事短期跟你无关
AntLing 为其 Ling-3.0-flash 发了一个"草稿模型"配合推理提速。背后是开源社区把注意力从"模型本身"转向"怎么跑得便宜",终端用户短期无感。
Aug 222 分钟
NVIDIANemotron
NVIDIA 把大模型从 66GB 压到 22GB 还快 4 倍 — 推理成本的故事正在改写
NVIDIA 的开源大模型 Nemotron 3.5 Lightning 推出 NVFP4 压缩版:体积从 66GB 缩到 22GB,速度最高提升 4 倍,精度声称无损。这件事值得关心——它直接改写 AI 推理的成本结构,企业自建 AI 的门槛被实质性拉低。
Aug 172 分钟
TurboQuantKV缓存
KV 缓存压缩出现独立评估工具 — 推理优化的重心正转向基础设施
KV 缓存是大模型长文本推理的显存大户,现在有人为 TurboQuant 压缩方案写了独立评估工具。这意味着推理优化正从'能不能跑'走向'怎么跑得稳'。
May 52 分钟