本周 Reddit 本地 AI 社区一个帖子被热议:一位用户拿着 16GB 内存的 MacBook Air M4 问,能跑视频生成模型吗?评论区给出的答案很直接 —— 现在还不行。这事看似小,但我们觉得它点出了一个被忽视的现实:本地 AI 的边界到哪了,普通用户其实心里没数。
这是什么
这位用户已经算「本地跑 AI」的典型用户了。16GB 统一内存(Mac 的内存是 CPU 和 GPU 共用的,类比过来相当于普通电脑的 32GB),能跑 120 亿参数(12B)以下的文字模型,能跑 6-7GB 大小的图片模型 —— 慢,但能跑。但一提到视频,答案就变了。
视频生成比图片吃资源得多。一段 5 秒的视频相当于几十张图叠加,还要保证帧与帧之间连贯不闪烁,对内存的需求通常是图片的 5 到 10 倍。当前主流开源视频模型(Wan 2.1、Mochi、CogVideoX)的最小可用版本基本在 12GB 以上,16GB 笔记本能跑但极其勉强,画质和时长都受严重限制。
换句话说:文字和图片的「本地 AI 自由」已经基本到了,视频还没到。Sora、Veo、可灵这些名字响亮的产品,全部跑在云端服务器上。
行业怎么看
社区里两种声音都有。
乐观的一方认为,参照图片模型的发展节奏——去年这时候本地跑图还卡得不行,现在 16GB 已经能跑——视频本地化只是再等一两年。Wan 2.1 已经发布了 13 亿参数的小版本,量化后(把模型精度从 16 位压到 4 位以减小体积)能在消费级显卡上跑通。这是清晰的进步趋势。
悲观的一方则提醒:视频的「帧间一致性」是难啃的硬骨头,靠简单压缩参数解决不了。短期内「本地跑视频生成」可能永远只是「能跑出东西」,和云端那种 1080p、几分钟长度的视频是两类东西。还有人指出硬件升级节奏在放缓 —— 16GB 内存的 MacBook 已是消费级顶配,再往上就是工作站级别,普通人够不着。
对普通人的影响
对企业 IT:如果公司想用 AI 生成视频做营销物料,目前只能订阅云服务(可灵、Pika、Runway 等)或采购带专业显卡的工作站。不要被「AI 普及」的口号误导,以为员工拿自己笔记本就能干。
对个人职场:处理文字、翻译、写稿这类工作,本地 AI 已经够用且有隐私优势(数据不出本机);但凡涉及视频,目前还是得用云端工具,按次或包月付费。
对消费市场:那些手机 App 里宣传的「一键生成 AI 视频」,背后基本都是云端算力 + 服务器排队,不是你手机自己能算的。看到「本地运行」「离线可用」这种标签,才说明是真在本地跑。