返回首页

推理优化

找到 6 篇关于此标签的文章

DeepSeek投机解码

开源大模型现在会'预判'下一句了 — 投机解码正在变成推理标配

最近有用户在本地显卡上跑开源大模型时,肉眼看到投机解码在工作——AI 提前猜出'美利坚合众国'这类高频短语,瞬间整句输出。背后是 MTP 多 token 预测技术。我们关心的是:本地推理的成本曲线正在被悄悄改写。

13h ago2 分钟
QwenRTX 3090

两块 3090 显卡跑 27B 大模型,每秒 165 字 — 本地 AI 第一次"够用"

我们注意到一位 Reddit 用户在两块 RTX 3090 游戏显卡(整机二手不到两万)上跑出 27B Qwen 模型每秒 165 字,达到接 Agent 任务的水准。本地大模型第一次从"只能玩"跨进"能干活"。

1d ago2 分钟
KV cacheLocalLLaMA

本地玩家发现提速诀窍:256k 长文本推理快 3 倍,但离商用还差几道坎

Reddit 上一位用户在小型模型上验证"分块缓存拼接"技巧,长文本 prefill 速度翻 3 倍且检索准确率未掉。这条帖子的真正价值是:本地长上下文推理的工程瓶颈,可能比想象中软。

Aug 222 分钟
AntLingLing-3.0-flash

国产大模型开始卷推理成本 — 但省钱这事短期跟你无关

AntLing 为其 Ling-3.0-flash 发了一个"草稿模型"配合推理提速。背后是开源社区把注意力从"模型本身"转向"怎么跑得便宜",终端用户短期无感。

Aug 222 分钟
NVIDIANemotron

NVIDIA 把大模型从 66GB 压到 22GB 还快 4 倍 — 推理成本的故事正在改写

NVIDIA 的开源大模型 Nemotron 3.5 Lightning 推出 NVFP4 压缩版:体积从 66GB 缩到 22GB,速度最高提升 4 倍,精度声称无损。这件事值得关心——它直接改写 AI 推理的成本结构,企业自建 AI 的门槛被实质性拉低。

Aug 172 分钟
TurboQuantKV缓存

KV 缓存压缩出现独立评估工具 — 推理优化的重心正转向基础设施

KV 缓存是大模型长文本推理的显存大户,现在有人为 TurboQuant 压缩方案写了独立评估工具。这意味着推理优化正从'能不能跑'走向'怎么跑得稳'。

May 52 分钟