这是什么
本周 Reddit 用户 /u/koalfied-coder 复刻了一份公开配方(GitHub: tonyd2wild/DeepSeek-v4-flash-0731-DSpark-1M-NVFP4-KV-2x-DGX-Spark),用两台 ASUS GX10 DGX Spark 工作站跑 DeepSeek V4 Flash 模型,参数规模比 V3 更小、定位"轻快便宜"。
成绩单:持续输出 67-84 token/s(每秒生成的中文字数大约比这个数更密一些),prompt 评估速度 2570 token/s,并启用 100 万 token 的上下文窗口。DGX Spark 是 NVIDIA 的"个人 AI 超算"——单台约 3 万元人民币,笔记本大小。两台合计约 6 万元,搭配 NVFP4(一种 4-bit 量化技术,把模型权重压到原来的四分之一)。
需要强调:这不是官方跑分,是民间复刻结果。
行业怎么看
支持者会指出:开源模型(尤其是 DeepSeek 这种中国选手)+ 量化技术 + 万元级工作站的组合,正在快速逼近"本地可商用"的临界点。如果这种配方被更多开发者复刻,海外大公司的封闭 API 护城河会被进一步压缩。
但冷静的声音也得说三件事:第一,67 token/s 跑的是 V4 Flash,不是旗舰,速度不能直接折算成能力;第二,6 万元的预算对中小企业才敏感,对绝大多数个人消费者仍然贵;第三,Reddit 复刻 ≠ 企业级可用——NVFP4 在 100 万上下文下的精度损失、长时运行的散热、多卡 NVLink 互通稳定性,这些都还没被严肃工程化验证。
对普通人的影响
对企业 IT:值得回头重算一笔总账。如果合规要求数据不出本地,这套方案的性价比正在追赶云 API;但还没到换供应商的时候——先让运维团队试着把 GitHub 上那个配方复刻一遍再说。
对个人职场:律师、分析师、研究员这种天天跟长文档打交道的人,大致 1-2 年内会出现"完全本地、不联网、对得起保密要求"的 AI 助理。先别急付年订阅费,按兵不动观察就行。
对消费市场:普通消费者还用不上这种硬件。但这个信号很明确:云端 AI 服务的降价空间仍然充足,文心、Kimi、通义们的 API 价格还会再往下走。