这是什么

inclusionAI 的工程师本周在 NVIDIA DGX Spark 桌面机上测试了自家 Ling-3.0-flash 模型 —— 1240 亿参数、Q5 量化(一种压缩格式,体积约为原模型一半)。他输入 33 字提示词后离开电脑,模型连续吐出 15,128 个 token,耗时约 7 分钟。

关键看速度:第 2,793 个 token 时解码 35.62 t/s,到 15,062 个 token 时仍是 35.68 t/s。中间 1.2 万 token 的 KV 缓存(模型记住已生成内容所需的中间状态)持续堆积,速度纹丝不动。

行业怎么看

乐观解读:稳定的长输出意味着本地推理(在自己硬件上跑模型,不调用云端 API)开始撑得住真实工作负载。KV 缓存不拖慢速度,是工程上的硬指标。

但我们更想指出隐忧:模型输出的仪表盘前端很漂亮,里面却是 Math.random() 假数据。提示词明明写了 "dummy data",它照做,但完全没读这台机器的真实 GPU 状态。「能跑」和「能用」之间仍有距离。此外 DGX Spark 售价数千美元起,7 分钟产出一个前端对多数企业场景仍偏慢。

对普通人的影响

对企业 IT:本地部署大模型正从「演示」进入「评估」阶段,金融、医疗等对数据不出门有强需求的行业,可以开始认真测试。

对个人职场:当前用 AI 写代码、整理长文档,云端 API 仍是性价比之选;但未来 12-18 个月,办公室放一台 AI 主机可能不再是科幻。

对消费市场:DGX Spark 这类桌面 AI 设备正打开一个新品类,类似当年的「游戏 PC」—— 暂非大众消费品,但已有早期用户群在形成。