这是什么

DeepSeek V4.1-Flash 这周被社区切成两半跑通了:模型从第 20 层切开,前半跑 Apple M5 Ultra,后半跑两张 RTX PRO 6000,中间用普通千兆/万兆网线连通。关键数字是它的 prompt state(理解为模型"对话时记的笔记")只有 0.9 KB/token——小到网络带宽根本不是瓶颈。我们的判断:DeepSeek 在工程层面持续"抠成本",正把 AI 竞争从"模型谁更大"拉到"谁部署更便宜"。

行业怎么看

开源社区的兴奋可以理解——本地大模型又往前迈一步。但冷静声音同样存在:

  • 演示不等于生态成熟。M5 Ultra 加两张 RTX PRO 6000 本身就是十几万人民币的组合,普通玩家根本用不上
  • 这套做法依赖 Apple Silicon 统一内存加 NVIDIA 显卡的特定组合,跨厂商兼容性没解决前,谈"普及"还早
  • 0.9 KB/token 是 V4.1-Flash 的卖点,不是所有 DeepSeek 模型都做得到

更深一层:DeepSeek 这轮动作指向"落地经济学"——AI 竞争的重心正从"参数谁大"转向"谁部署便宜、谁场景多"。

对普通人的影响

  • 对企业 IT:私有部署的成本结构可能开始变化——以后不一定非要全 NVIDIA 栈,混合架构成了新选项
  • 对个人职场:现在还远谈不上日常可用,但提示"公司电脑直接跑模型"比"公司按调用量买 API"更可能成真
  • 对消费市场:Mac 工作站的 AI 定位会更突出,企业硬件采购的组合方案明显变多