返回首页
KV缓存
找到 3 篇关于此标签的文章
Qwen本地部署
16G 显卡跑 Qwen 撞上'性能悬崖' — 本地大模型的门槛,比你想的高
一个 Reddit 用户发现,Qwen3-27B 在 16G 消费级显卡上把 KV 缓存精度从 q4_0 调到 q4_1,性能就从每秒 9 个 token 暴跌到 1.5 个。这件事告诉我们:本地跑大模型远没有'装上显卡就能用'那么简单,背后是工程上的硬约束。
Aug 152 分钟
TurboQuantKV缓存
KV 缓存压缩出现独立评估工具 — 推理优化的重心正转向基础设施
KV 缓存是大模型长文本推理的显存大户,现在有人为 TurboQuant 压缩方案写了独立评估工具。这意味着推理优化正从'能不能跑'走向'怎么跑得稳'。
May 52 分钟
Microsoft大模型推理
微软让大模型推理提速4倍:AI行业下半场是抠基建成本
微软在系统顶会展示多项AI基建成果,包括让大模型推理吞吐量提升4倍的缓存共享技术。这说明AI竞争正从卷参数转向拼基础设施效率,降本将成主旋律。
May 52 分钟