本周 Reddit 上一条技术帖给出数据:苹果 M5 Ultra 跑国产开源模型 GLM-flash,把一个叫 prefill step(预填充分块大小——模型回答前先把输入文本"预读"的处理粒度)的参数从 2048 调到 8192,13 万 token 长文档的总推理时间从 220 秒降到 185 秒,缩短两成。这意味着本地大模型正在悄悄跨过一道隐形门槛。

这是什么

发帖的工程师在测试苹果最新 M5 Ultra 时发现,推理引擎(让模型真正"跑起来"的执行程序)在处理长文本时会把输入切成小块一段段吃进去——这个块大小直接决定效率。用默认 2048 时一个 13 万 token(约等于 6-7 万汉字)的文档要跑 220 秒,调到 8192 后只要 185 秒,且短一点的输入提速更明显。

关键不止这个参数。苹果自研的推理框架 MLX 与第三方引擎 omlx 过去半年快速迭代。过去要 A100/H100 这种万元级显卡才能扛住的模型,如今在四万多元的 M5 Ultra Mac Studio 上已经能跑出 700+ tokens/s 的生成速度——每秒稳定吐出的字数。

行业怎么看

乐观派认为这是 Apple Silicon(苹果自研芯片)正式进入 AI 推理主战场的信号,本地化和云端化的天平开始摇摆。GitHub 上过去半年针对 MLX 优化的开源项目数量翻了一倍,这个生态正在成为继 NVIDIA CUDA 之后的第二个 LLM 推理底盘——意义远大于一次参数调优。

但谨慎声音同样值得听。一位长期跟踪推理优化的技术分析师在邮件里告诉我们:prefill 优化的边际收益会快速递减,8192 之后基本到顶;并且 omlx 这类引擎对算力的调用仍不稳定,长文档处理时偶有显存溢出。更关键的是,这些性能数字只对会读 log(运行日志)、调参数的开发者有意义——距离普通白领打开 Mac 就能开箱即用,至少还差两代产品周期。

对普通人的影响

  • 对企业 IT:本地推理速度正在逼近云端的实测水平,未来一年企业可以重新评估私有化部署的成本账,金融、医疗、法律这些数据敏感行业最先可能考虑。
  • 对个人职场:技术岗位和创意岗位(写代码、做视频、搞设计)是第一批受益者,已经能把部分任务从云端挪回本地 Mac;普通文员、行政岗暂时还感觉不到差别。
  • 对消费市场:M5 Ultra Mac Studio 定价四万起,属专业生产力设备定位;普通消费者目前不需要为"AI 本地化"专门换电脑,这件事还要再看两三年。