这是什么
GitHub 用户 syv-ai 昨天在 RTX 3090(24GB 显存,二手价 1500-2000 元)上把阿里通义千问 27B 参数大模型跑到了 99 tokens/秒(单请求)和 1150 tps(批处理)——这意味着 2000 元级别的消费级硬件,已经能流畅运行中等尺寸大模型。
99 tps 远高于普通成年人阅读速度(4-5 tps),用户用起来感觉不到"等"。这件事的关键不是"跑起来了",而是"跑得流畅"。
行业怎么看
开源社区的兴奋点在于:硬件门槛的下沉速度比多数人预期的快。但需要冷静:99 tps 是深度优化的结果——fp8 kv cache(把模型的"短期记忆"用低精度存)、int8 量化(用低精度数字计算)、FlashAttention(更快的注意力算法)、概率采样,每一项都是技术活。普通用户照搬跑不通的概率不小。
另一种克制的判断:RTX 3090 已停产 4 年,现在消费级主力是 4090/5090,3090 的参考价值更多在"思路验证"而不是"今天就买"。99 tps 跑的是中等尺寸模型,"本地替代 ChatGPT"的结论还早——这是社区胜利,不是终局。
对普通人的影响
对企业 IT:本地化部署的硬件成本继续降低,但"调优的人工成本"才是新的瓶颈,别被硬件价签迷惑。
对个人职场:数据敏感岗位(法务、财务、研发)可以认真评估本地 AI 方案,"数据必须上传云端"不再是唯一选项。
对消费市场:消费级显卡被 AI 玩家和游戏玩家抢货的格局短期不会变,二手 3090 价格可能被这股热潮托住。