这是什么
Llama.cpp 升级到 ROCm 7.14 后,AMD Radeon 780M 集成显卡(即集成在 CPU 里的 GPU)在跑 Qwen 3 27B 这类稠密模型(dense model,每次推理激活全部参数的模型)时,速度比上一代 Vulkan 路径(另一套 GPU 调用接口)快了约 50%。这意味着 AMD 第一次有了对会写命令行的用户真正可用的本地大模型方案——但仅限于稠密模型,且要求用户手动从源码编译。
行业怎么看
对关注本地 AI 部署的玩家来说,这是一次有意义的信号:AMD 终于有了与 NVIDIA CUDA 并列的现实选项,过去一年买不到高端显卡的尴尬,可能在普通办公电脑上就能跑得动 27B 参数级别(参数越多模型越聪明但越吃硬件)的模型。
但反对意见同样明确。首先,这一性能提升仅限稠密模型;在 Qwen 3.5 35B A3B 这类 MoE 模型(混合专家架构,每次只激活部分参数)上,Vulkan 反而更快,AMD 优势不能简单外推。其次,ROCm 7.14 稳定性仍未完全解决,测试者需要去掉部分内核启动参数才能避免崩溃。最后,AMD 软件生态与 NVIDIA 仍有差距,社区能跑通的模型清单远小于 CUDA 平台,出了问题也基本靠自己排查。
对普通人的影响
对企业 IT:评估本地化部署方案时,AMD 平台首次有了"值得列入对比"的硬件选项,但短期内仍主要适用于技术验证环境,不建议直接上生产。
对个人职场:除非你日常用 Linux、会写命令行,否则这件事与你无关——通过云端 API 调用依然是最省心、最便宜的路径。
对消费市场:未来 12-18 个月,搭载 AMD 显卡的轻薄本可能成为"够用且便宜的本地 AI 入口",但要看 OEM 厂商是否愿意预装相关工具链,否则用户依然用不起来。