本周,一位 Reddit 社区开发者宣布自己花了两周时间,把 Mac 上跑大模型的所有主流框架测了个遍,结论很直接:软件生态"一团乱麻",落后英伟达一整代。

这不是个例抱怨,而是个系统性问题:苹果 AI 芯片硬件(M 系列)性能不差,但配套的软件框架碎片化严重,想用 Mac 跑本地大模型的公司和个人,可能要做好踩坑准备。

这是什么

在 Mac 上跑大模型(让 AI 在你自己的电脑上运行,不调用云端 API),需要一套叫"推理框架"(inference framework)的软件,负责让模型跑得快、跑得省内存。

在英伟达 GPU 上,这套体系已经成熟:vLLM、llama.cpp、TensorRT-LLM 等主流框架都内置了关键技术——prefix caching(重复内容缓存)、speculative decoding(投机式解码,一次生成多个 token 再验证)、paged KV cache(分页式内存管理)、flash attention(高效注意力计算)。

在 Mac 上,这些优化散落在 mlx-lm、vllm-metal、各种社区 fork 里,没人做完整集成。最新的 Qwen 模型还用了 hybrid KV/recurrent 架构(一种新的内存管理方式),让整合难度进一步上升。

换句话说:Mac 硬件能跑,但软件生态还停在"各干各的"阶段。

行业怎么看

支持方认为,vllm-metal 是目前最接近完整方案的框架,社区也在呼吁整合,而不是再开新分支。

但我们更关心反对声音。几个值得警惕的点:

第一,作者有开发者视角的偏差,但他点出的问题客观存在——不是性能差距,是软件成熟度的代差。同样模型,在英伟达 GPU 上能跑出社区宣传的速度,在 Mac 上往往要打折扣。

第二,苹果官方对 AI 推理生态的整合意愿一直模糊。WWDC 大谈 Apple Intelligence,但底层框架的统一和优化没人牵头。

第三,也是最值得企业用户警惕的:"Mac 跑 AI"的营销叙事和实际开发者体验之间,存在明显落差。

对普通人的影响

对企业 IT:想用 Mac mini 集群跑本地模型降本增效的公司,建议先等等。硬件省钱,软件踩坑的成本可能更高。

对个人职场:Mac 用户想本地体验大模型,目前体验和速度都不如用云端 API。可以等 vllm-metal 进一步成熟,或直接用网页版。

对消费市场:苹果卖 Mac 时强调的"AI 能力",更多是端侧小模型(Apple Intelligence),真要跑千亿参数级别的大模型,现阶段还是英伟达的天下。