找到 1 篇关于此标签的文章
Reddit 开发者 neuroma 在两块 AMD Radeon R9700 上把 DeepSeek-V4-Flash 跑到了 40-50 tok/s,配合专为该模型写的推理引擎和预量化版本,262K 上下文也撑得住。这件事值得关心,是因为本地跑顶级开源模型不再是 NVIDIA 显卡的专利。