这是什么

llama.cpp 是开源社区最主流的本地大模型推理工具(让你电脑显卡直接跑开源大模型,不必走云端)。本周它合并了一项更新:给 AMD RDNA3/RDNA4 架构(对应 RX 7000/9000 系列消费级显卡)加入新的 Vulkan 后端代码(Vulkan 是跨平台 GPU 加速接口,AMD 与英伟达都支持),核心改进是 int8 coopmat1 矩阵乘法实现——int8 是一种低精度计算格式,用 8 位整数代替常用 32 位浮点,能让 GPU 一次吞吐更多数据。

实测数据:在 RX 7900 XTX 上跑一个 26B 参数的开源模型,批量处理(pp512,相当于一次性喂入 512 字让模型做总结)从每秒 3410 tokens 提升到 4331,提升约 27%;实时逐字生成(tg128,相当于聊天场景)从每秒 135 tokens 提升到 143,提升约 5%。

行业怎么看

开源社区普遍欢迎这次更新。长期被英伟达 CUDA 生态(CUDA 是英伟达的 GPU 编程框架,几乎所有 AI 软件都优先适配它)压制的 AMD 用户,终于在本地大模型场景看到硬件性价比有了兑现的可能。提交者 nickm_27 在 Reddit 上的实测帖被广泛引用。

但也有冷静的声音需要留意。第一,5% 的生成速度提升对日常聊天体验几乎无感,27% 的提升主要利好企业「喂长文档做批处理」场景,普通用户感知不强。第二,这次更新只覆盖消费级 RDNA3/RDNA4 架构,企业数据中心常用的 AMD Instinct 专业卡、Mac 用户的 Apple Silicon GPU 都不在受益范围内。第三,llama.cpp 核心维护者尚未对这次合并做官方背书,社区测试样本仍较有限,是否会回滚或调整还要观察。

对普通人的影响

企业 IT:如果公司想自建内部 AI 助手、避免数据传到云端,AMD 显卡的硬件采购成本大约只有英伟达同档方案的 60%–70%,软件性能差距正在收窄,采购评估模型需要更新。

个人职场:用一张万元级别的消费级显卡在本地跑 26B 模型已经能做到每秒 140 字的生成速度,处理会议纪要、合同摘要这类任务不再必须调用云端 API。

消费市场:在「AI PC」概念之外,「AI 工作站」——用消费级显卡在家或办公室本地跑大模型——正在悄悄成为中小企业和独立专业人士的新选项。