本周值得记录的一个数字:一位开发者在 M2 Ultra Mac 工作站(约 5 万元人民币、192GB 内存)上跑通了 DeepSeek 最新开源模型,生成速度 25.8 token/s——意味着每秒可输出约 26 个汉字,已能流畅对话。值得注意的是,他用一种叫「无损重打包」的方法,把模型压到 141GB,比官方量化版还小,质量却完全一致。

这是什么

DeepSeek(深度求索)是中国头部开源大模型公司。社区帖中提及的「V4 Flash」属其最新一代大模型,采用 MoE 架构(即把一个大模型拆成多个「专家」子模型按需调用——体积虽大,实际推理算力需求可控)。

作者的关键操作是:fork(分支复制)开源推理框架 llama.cpp,做了三件事——模型无损重打包、用 SSD 暂存对话缓存(KV cache,即模型的「短期记忆」)、动态分配 8 条处理通道,最终实现 100 万 token 总上下文窗口。

结论:开源社区已能在专业工作站上以接近实时的方式运行一款前沿级中国大模型,且全程本地、不联网。

行业怎么看

乐观的看法:开源中国大模型的本地部署,从此不再是「勉强能跑」的演示,而是真能干活了。对金融、医疗、政企等数据不能出本地的客户,这是实质利好——不必完全押注闭源 API。

但我们要泼点冷水。第一,硬件门槛 5 万元起步,还要开发者手改底层代码,复制难度极高,离「IT 部门开箱即用」仍有距离。第二,社区帖中的「V4 Flash」并非 DeepSeek 官方已确认的正式版本,命名需谨慎看待。第三,25 token/s 对话够用,但用于批量处理文档、运行 Agent 自动化(让 AI 自主完成多步任务),仍有数量级差距。

对普通人的影响

对企业 IT:开源大模型的天花板在被一点点磨平,但若团队没有懂底层推理框架的人,短期内的性价比仍不如直接调用闭源 API。

对个人职场:除非自购顶配 Mac Studio 且愿意折腾命令行,否则这件事和你无关。它的间接信号是——未来一年「本地 AI 助手」会更便宜、更快。

对消费市场:暂无直接影响,仍是极客圈实验。