Reddit 用户 neuroma 在两块 AMD Radeon R9700(每块 32GB)上把 DeepSeek-V4-Flash 跑到了 40-50 tok/s、撑起 262K 上下文——这是开源大模型第一次在非英伟达消费级显卡上接近实用速度。

这是什么

关键不是又一张跑分贴,而是三件同时发生的事:一、有人为 V4-Flash 写了专用推理引擎 affinity(模型在硬件上执行计算的中间软件),作者 Yoshi Exeler,思路是热门专家层留 GPU、其余从内存流式读取。二、neuroma 在 Hugging Face(AI 模型开源社区)放出预量化版本,省掉 149GB 下载和 2.5 小时量化时间。三、整套方案跑通 15 轮让 AI 自主调工具的 Excel 转 DuckDB 任务,每一轮工具调用都没出错。

行业怎么看

乐观的读法:AMD 消费级显卡第一次能稳定跑顶级开源模型,我们注意到过去「本地 AI = NVIDIA」的局面开始松动;企业自托管(把模型部署在自家服务器上)DeepSeek 级模型可能不再必须上 H100 集群。

但需要警惕:方案只支持 AMD 最新显卡架构 RDNA4、限两张卡、主机内存 64GB 起;该量化版本在温度参数 0.6 时会陷入推理循环,原作者也承认 V4.1 实验分支只有 14 tok/s。这是一个令人兴奋的信号,还不是生产可用的方案。

对普通人的影响

对企业 IT:自托管 DeepSeek 级模型不再必须买 NVIDIA 高端卡,两张中端 AMD 值得列入备选清单。

对个人职场:开发者和硬核玩家有新玩具,普通白领用不上——这是半年到一年后才会传到办公桌前的间接信号。

对消费市场:AMD 的「AI PC」叙事多了一个具体支点,长期可能挤压 NVIDIA 显卡定价,但短期不改变多数人购物选择。