找到 1 篇关于此标签的文章
一位开发者在 RTX 6000 PRO 上测试 llama.cpp 多种“推测式解码”(先由小草稿模型猜,再让大模型逐词验收)方案,Qwen 3.6 27B 在真实多轮改代码任务里最高提速约 6 倍。值得关心的不是跑分,而是本地 AI 的可用性正被工程优化快速拉高。