返回首页
MTP
找到 6 篇关于此标签的文章
OrnithMTP
Ornith 1.5 出厂带了个没训练的部件 — 开源 AI 品控问题被低估了
Ornith 1.5 大模型被扒出发版时附带一个未经训练的 MTP 模块。这不是简单 bug,而是开源 AI 生态品控机制的缩影,值得每一个想用它降本的企业重新审视。
Aug 202 分钟
llama.cppMTP
llama.cpp 上线'自适应猜词'模式 — 本地跑大模型的人,少一个要调的参数
本周开源项目 llama.cpp 上线'自适应'多 token 预测(MTP)模式,让模型自己决定一次猜几个字。写代码场景最快能翻倍,但普通文本反而慢约 3%。这意味着本地部署大模型的工具链正在从'手动调参'向'系统自调'迁移。
Aug 172 分钟
EAGLE3llama.cpp
EAGLE3 并入 llama.cpp,开源大模型推理开始更务实地追求提速
EAGLE3 经过半年开发正式并入 llama.cpp,核心意义不是又多了一个术语,而是开源社区在大模型推理提速上走向更务实路线:不只靠更强硬件,而是靠更聪明的生成流程,把本地部署的可用性再往前推一步。
Jun 122 分钟
llama.cppLocalLLaMA
llama.cpp 用户实测:量化草稿模型未必更省,反而会吃掉更多上下文
一组 llama.cpp 实测数据显示:在 MTP(多词元预测,用更小草稿模型提前猜下一个输出)场景下,把 spec draft 量化成 q4_0 不一定更省资源,反而可能让上下文窗口从 91648 降到 83200。值得关心的是,本地大模型优化开始进入“参数调一档,结果差很多”的阶段。
Jun 52 分钟
QwenRTX 3090
消费级显卡跑通 100K 上下文 — 本地大模型部署的硬件门槛正在快速降低
一块 RTX 3090 跑 27B 模型、100K 上下文、50 tokens/s,背后是量化+MTP 推测解码+KV 缓存压缩的组合优化。消费级硬件的推理能力正在逼近一年前的企业级方案,关心本地部署的人值得留意这个趋势。
May 72 分钟
llama.cppMTP
llama.cpp MTP 支持进入 Beta — 本地大模型推理的速度短板开始补了
llama.cpp 开始支持 MTP 多 token 预测,目前适配 Qwen3.5。结合张量并行成熟,本地推理框架与云端服务之间的速度差距正在收窄,对本地部署大模型的可行性有实质提升。
May 42 分钟