返回首页
GGML
找到 3 篇关于此标签的文章
Llama.cppMeta
Llama.cpp 跨入 0.2 时代 — 普通人用家用电脑跑大模型的门槛又下一城
开源大模型推理引擎 Llama.cpp 推出 0.2.0 版本,是该项目首个 0.2 系列,意味着架构与性能做了系统性升级。对关心数据本地化、企业私有部署、以及不想被云厂商绑定的读者,这条新闻值得跟踪。
8月22日2 分钟
llama.cppQwen3
GPoUr with ~12gb vram and a 3080 getting 40tg/s on qwen3.6 35BA3B w/ 260k ctx
ll ama.cpp 的 turboquant 分支通过 turbo3 KV cache 量化, 在单张 RTX 3080 12GB 显存上实现 Qwen3-35B-A3B 约 40 tok/s 推理速度,并支持 260k 上下文窗口。
4月16日2 分钟
GGMLllama.cpp
GGML 新增 Q1_0 1 比特量化:以 1.15GB 运行 8B 模型
GGML 现已支持 Q1_0 1 比特量化,将 Bonsai 8B 模型压缩至 1.15GB,实现纯 CPU 推理,大幅降低部署门槛。
4月6日2 分钟