返回首页
推测解码
找到 5 篇关于此标签的文章
DFlash 2Inco AI
推理快 2.26 倍是真的,「8 倍」漂亮数字是假的 — 一次诚实的加速测试
一家叫 Inco AI 的团队发布开源推理加速方案 DFlash 2,号称比上一代更快。但更值得讨论的是:一位开发者花三天做基准测试,主动戳破社区里流传的「8 倍」漂亮数字 — 这个时代的 AI 提速,连测试本身都可能成为话术陷阱。
Aug 232 分钟
llama.cppQwen3
Reddit 用户让本地 AI 提速 65%,但官方还没接盘
本周 r/LocalLLaMA 有开发者发布 llama.cpp 分支,用「DSpark PC Tree」推测解码技术把 Qwen3 跑速提升约 65%。这是单点实验,未被官方合并,但它折射的趋势值得关心:本地跑 AI 越来越便宜、越来越快。
Aug 212 分钟
LocalLLaMA推测解码
让 AI 边想边动手 — 推测解码终于跑进 Agent 工具调用
一项新论文把推测解码(speculative decoding)引入 Agent 调用工具的环节,意图让 AI 在「思考+动手」时跑得更快。这关系到未来本地部署(local deploy)的 Agent 是否真的能用,值得每个关心 AI 效率的人留意。
Aug 92 分钟
inclusionAILing-3.0-flash
两个开关让小模型吞吐近翻倍 — 但隐藏的兼容陷阱比速度更值得警惕
inclusionAI 的 Ling-3.0-flash INT4 模型在 DGX Spark 上仅靠两项配置变更,生成速度从 20.8 提升到 38.7 token/秒。但默认 vLLM 缺少 V3 架构支持,会输出看似正常实则错误的文本。对本地部署和选型的团队而言,这是个隐蔽的工程雷区。
Aug 92 分钟
Gemma 4LiteRT
Gemma 4 发布时 Google 禁用了隐藏的 MTP 头部
开发者在 Gemma 4 的 LiteRT 文件中发现了多 token 预测权重;Google 确认 MTP 存在但被故意禁用,旨在确保兼容性与广泛可用性。
Apr 72 分钟