本周 Reddit 的 LocalLLaMA 板块出现一个值得收藏的配置单:有人在 Ryzen 5600 + 64GB DDR4 + 一张 Radeon 7600(整机成本约 2000 元出头)上,用 llama.cpp 跑通了阿里 Qwen 3.5 35B A3B 的 Q8 量化版本,推理速度稳定在 18 token/s。

这是什么

Qwen 3.5 是阿里通义实验室的 350 亿参数 MoE 架构大模型(混合专家架构,即模型内部按问题类型调用不同「子模型」,实际激活参数远小于总量)。Q8 是把模型权重从高精度浮点压缩到 8 位整数,体积约 35GB。18 token/s 大致是「读一句、回一句」的节奏,做对话、写代码、跑本地知识库都已基本流畅。

这件事的关键不是「Qwen 很强」,而是「一张中端显卡就能跑得动」。

行业怎么看

支持的声音认为:本地推理(数据不出本机)是 AI 进入金融、医疗、政务等敏感行业的真正入场券,云端 API 永远解决不了合规问题。Radeon 7600 这种消费级显卡能跑 35B,意味着中小企业完全可以自建,不依赖云厂商。

反对的意见同样值得关注:第一,18 token/s 是「流畅阅读」,不是「流畅写作」,长文档生成、多轮 Agent 协作依然吃紧;第二,这套配置跑得动不代表普通人调得动——llama.cpp 的 37 层 CPU MoE 卸载、量化精度、上下文长度都需要手动权衡,门槛依然存在;第三,Qwen 3.5 35B 的实际能力,在英文推理、复杂代码任务上和 GPT-4o、Claude 仍有可见差距,硬件可及不等于产品可替代。

对普通人的影响

对企业 IT:如果团队涉及客户隐私、内部数据或行业监管,「一张显卡 + 一台工作站」的本地部署方案开始进入采购视野,不必再把全部预算押在云 API 上。

对个人职场:愿意折腾的人可以用 2000 元的代价,把「自己的 AI 助理」搬出服务器,处理写作、摘要、翻译这类日常任务,但前提是你愿意花一两个周末调参。

对消费市场:这是「AI 装进家电、装进车机」的前置信号——消费级硬件跑得动 35B,意味着未来一年会看到更多端侧 AI 产品(不带云的那种)出现在我们身边。