这是什么
本周 Reddit 本地 AI 部署社区 r/LocalLLaMA 出现一篇实测评测帖:用户 Legitimate_Hat_7852 用 NVIDIA 去年推出的 DGX Spark(一种小型 AI 推理工作站,单机可跑大模型)搭了 4 卡集群,同时部署 DeepSeek V4 0731、Qwen 3.8 Flash、GLM 5.3 Flash 三款中国头部开源模型(代码和权重公开、可免费下载运行的 AI 大模型)。
GLM 5.3 Flash 因生成内容过于冗长、双卡速度只有 22 tok/s(每秒生成 22 个词,远低于流畅阅读所需的 60+)被淘汰。最终方案是:DeepSeek 跑主任务(规划与构建),Qwen 跑子任务(探索与调用,把活拆给 AI 助手去办)。
行业怎么看
这是一个个人用户的折腾笔记,但透露三个编辑部值得留意的信号:
第一,中国头部开源模型之间的差距,开始从「能不能用」转向「风格差异」。一年前大家还在比 benchmark(模型跑题考试的成绩),现在拼的是谁更配合你的工作流——这意味着模型能力追平之后,「用得顺不顺」会成为新的胜负手。
第二,多模型分工是 2025 年下半年 AI 落地最明确的小趋势。业界叫 multi-model orchestration(多模型编排):不找一个万能模型,而是按速度、成本、长处组合使用。这条路比「等一个超级模型」更现实。
需要警惕的风险:这种部署高度依赖硬件。DGX Spark 单机万元起,4 卡集群对中小企业仍是奢侈品。该帖作者是技术极客,工作流无法直接复制到普通公司。所谓「多模型分工」目前仍是有研发能力团队的玩具。
对普通人的影响
对企业 IT:选型逻辑要改。别再问「哪家模型最强」,改问「我的活能不能拆成两类——一类要准、一类要快」。多模型组合方案可能比统一采购一家更划算,也更耐风险。
对个人职场:暂时轮不到你操心部署。但「我会让 AI 干活」这种笼统说法正在贬值;会拆活、会挑工具的人领先一截,剩下的人只是「会用 ChatGPT」。
对消费市场:暂时无感。开源模型再便宜,本地部署门槛(万元硬件 + 技术能力)决定它进不了消费市场。但云厂商会借此压价,未来面向消费者的 AI 功能大概率更便宜、跑得更快。