这是什么
本周 Reddit 本地 AI 社区(r/LocalLLaMA)出现一个有意思的提问。一位用户准备入手 AMD 旗舰消费显卡 PowerColor R9700,用来跑阿里 Qwen3 系列的 27B 模型(参数量 270 亿)。他用的是 llama.cpp(开源本地推理框架)和 Vulkan(AMD 显卡的 AI 计算接口)。
他抛出来的数字值得玩味:AMD 官方博客称 R9700 能跑到 51.8 tokens/秒(生成速度),但没标上下文长度,也没说明是否开了 MTP(多 token 投机解码——简单说就是让模型一次猜多个字再校验,能加速但多吃显存)。而 NVIDIA 5090 的实测数据更扎眼——Qwen3 新版本在 4K 上下文(约 3000 字)时跑 75 tokens/秒,到 64K(约 5 万字)时只剩 26,下降 65%,比上一代还明显。
他不是在问「能不能跑」,而是在问「真用起来能跑多稳」。
行业怎么看
我们注意到,社区里多数技术玩家认同这位用户的疑虑——峰值跑分已经越来越没人信。Qwen 团队没在 64K 上下文下公布自家数据,AMD 也没标测试条件,这种「选择性披露」在硬件圈见怪不怪。
但也有反对声音。有开发者指出,MTP 投机解码技术还处于早期,CUDA(NVIDIA 的 GPU 计算平台)平台上有用户报告显存溢出和输出乱码,用 AMD 的 Vulkan 接口只会更不稳定。也有人认为 27B 模型本来就不是为单卡设计的,硬塞消费级显卡属于「既要又要」。
更值得警惕的是:企业真实场景(合同审阅、代码库分析、长报告生成)几乎都是长上下文,一旦模型在这里性能崩盘,本地部署替代云端 API 的成本故事就讲不下去——这也是当前 AI 落地最大的隐性成本之一。
对普通人的影响
对 企业 IT:采购 AI 服务器时别只看厂商公布的峰值速度,要追问「32K 以上上下文时的持续吞吐」,否则算力和电费账都吃不消。
对 个人职场:如果你打算在办公电脑上装本地模型辅助长文档工作,先确认硬件撑得住;否则等模型响应的时间,可能比你亲手写还长。
对 消费市场:AMD 对 NVIDIA 的挑战在 AI 推理领域才刚开张,R9700 这类消费级显卡能否真正承担 AI 任务,决定了未来万元级 PC 是不是真能「装一台家用 AI 主机」。