30 TPS 还是 150 TPS?这是 Reddit r/LocalLLaMA 板块本周最热闹的争论——本地跑大模型到底多快才「够用」,开发者吵了一周没结果。但这场口水战里藏着一个真问题:企业想用本地 AI 替代云端,先得过速度这一关。

这是什么

发帖者问得很直接:本地跑大模型,TPS(Tokens Per Second,每秒生成的「字数」)低于多少你受不了?

回复里分成了两派。一派坚持 30 TPS 就够用——AI 输出本来就比人读得快,30 已经超过多数人的阅读速度,再快也消化不了。另一派觉得 30 像在「看 PPT 翻页」,必须 100 TPS 以上才有「对话感」,最好能冲到 150 以上。

分歧背后是本地 AI 的硬件取舍:30 TPS 用消费级显卡(Mac M 系列、中端 N 卡)就能跑 7B-13B 模型;150 TPS 需要顶级消费卡或专业卡,且往往要在模型质量上做让步。

行业怎么看

支持 30 TPS 够用的开发者认为,本地 AI 的核心价值是隐私和成本,速度是次要的。有人算账:用 M3 Max 跑 30 TPS 的模型,每月电费几十块,比订阅 ChatGPT 便宜,数据还不出门。

反对意见更尖锐。不少开发者指出,30 TPS 只适合「读」,不适合「聊」——一旦要做多轮对话、调试代码、实时翻译,30 TPS 会让人焦虑到想关掉窗口。一位用户直言:「低于 60 TPS 我会本能觉得 AI 卡了,体验和云端 GPT-4o 差出一个时代。」

还有一层风险被讨论得少:很多企业宣传「本地部署」时只说数据安全,不提速度代价。真到了员工每天用,30 TPS 和 150 TPS 的体验差,会直接决定这套系统是被「天天打开」还是「装完吃灰」。

对普通人的影响

对企业 IT:评估本地 AI 部署时,不能只看模型跑分,要把「日常使用 TPS」写进采购指标——30 和 150 之间的硬件成本可能差 3-5 倍。

对个人职场:如果你正考虑买台 Mac 跑本地 AI 替代部分订阅服务,先想清楚你主要场景是「读长文」还是「对话协作」,前者 30 TPS 够用,后者建议攒钱上更强配置。

对消费市场:未来 AI 手机、AI PC 的宣传话术会越来越强调「端侧 TPS」,这是一个比「参数量」更实在的体验指标——以后看广告可以多留意这个数。