返回首页

Llama.cpp

找到 5 篇关于此标签的文章

Llama.cppMeta

Llama.cpp 跨入 0.2 时代 — 普通人用家用电脑跑大模型的门槛又下一城

开源大模型推理引擎 Llama.cpp 推出 0.2.0 版本,是该项目首个 0.2 系列,意味着架构与性能做了系统性升级。对关心数据本地化、企业私有部署、以及不想被云厂商绑定的读者,这条新闻值得跟踪。

Aug 222 分钟
千问Qwen

千问 27B 单卡跑出 80 步 Agent — 本地模型开始能替人干活了

本周 Reddit 一则实测让人侧目:千问 27B 模型在一张消费级显卡上,仅凭一段提示词就自主调用 80 次工具完成查课表、抓视频、转录等任务。这不只是技术演示,'Agent 必须跑云端'的默认假设正被开源改写,门槛塌得比多数人预想的快。

Aug 202 分钟
AMDLlama.cpp

AMD 显卡跑本地大模型快 50%,但目前还有使用门槛

Llama.cpp 升级到 ROCm 7.14 后,AMD Radeon 780M 集成显卡跑稠密模型比 Vulkan 路径快约 50%。AMD 第一次有了对普通用户真正可用的本地 AI 方案,但仍限于一类模型且需手动编译。

Aug 172 分钟
Llama.cppGeorgi Gerganov

Llama.cpp 作者被集体感谢:一个人撑起开源 AI 半壁江山

保加利亚程序员 Georgi Gerganov 一个人主导的 Llama.cpp,让大模型跑进普通电脑。Reddit 本地 AI 社区集体向他致谢 — 这背后是一个被低估的事实:整个本地 AI 生态都建立在他的个人代码上。

Aug 162 分钟
DeepSeekDeepSeek-V4

DeepSeek V4 在 32GB 笔记本跑出 70 tok/s — 本地大模型终于能塞进一台电脑了

有开发者把 DeepSeek V4 这类超大 MoE 模型硬塞进 32GB 内存笔记本,靠重排权重和投机预取专家层,跑出 70 tok/s 的输入速度。虽然输出还慢,但证明消费级硬件跑顶级模型正在变成现实。

Aug 92 分钟