这是什么
Reddit 上 r/LocalLLaMA(本地跑大模型爱好者社区)这周出现一个叫 human-tps 的网页工具。开发者 HomoAgens1 模拟 AI 模型常用的『每秒生成 token 数』(即『打字速度』)指标,让人也来测一测自己能『打』多快。结果:他本人最佳成绩是 2 token/秒。
对照数据更有意思:这个速度跑赢了 70B(700 亿参数)大模型在笔记本电脑 CPU 上的输出速度,但比 RTX 4090 显卡跑 8B(80 亿参数)模型慢约 76 倍。换句话说,你的手指比笔记本 CPU 跑的大模型还快,跟专业显卡比又慢得离谱。
开发者也坦承这是玩票 — 网站结尾写着『so for open it while waiting for your LLM to answer』(等 AI 回话时玩一下)。但这则帖子在社区被顶到首页高位。
行业怎么看
本地 AI 圈把它当段子传,但点出的真问题是硬件代差。业内共识:模型本身在变小(8B、4B 已经能打),但推理(让训练好的模型回答问题)所需的算力没降下来。模型在进步、消费级硬件跟不上 — 这就是『本地跑 AI』一直小众的根本原因。
反对意见:有人会指出,这个对比对云端 AI 服务毫无参考价值 — 企业级 GPU 集群的 token/秒比 4090 还高几个数量级,消费者级硬件的瓶颈不能代表整个行业。同时也有人质疑:token/秒只是『打字速度』,不含理解、推理、调用外部工具的真实时延,用它衡量 AI 性能本身就是偷懒。
对普通人的影响
对企业 IT:本地部署 AI 看起来省钱,但 GPU 服务器、机房散热、电力这些硬件成本才是隐藏大头,决策时别只盯着软件授权费。
对个人职场:日常工作里『AI 慢』往往不是模型笨,是设备在拖后腿;现阶段用云端 AI(ChatGPT、通义、文心等)反而比本地部署更划算。
对消费市场:AI 硬件创业(AI PC、个人 AI 盒子)有真实需求,但性价比目前仍远不如直接调用云端 API — 短期内别为『本地 AI』多花钱。