这是什么
本周 Reddit 的 LocalLLaMA(本地跑大模型的爱好者社区)有人发帖:他用一个叫 1Cat-vLLM 的 vLLM 分支(vLLM 是主流开源推理框架,专门优化"一次服务多个请求"时的吞吐速度),让英伟达 2017 年发布的 V100 显卡重新跑起了 350 亿参数级别的大模型。基准测试显示,V100 上的推理速度接近一颗新出的消费级芯片 Strix Halo。
这不是产品发布,而是开源社区的一次性能优化实践。但它指向一件值得注意的事:十年前的硬件,软件优化到位,依然能跑中等规模的大模型。
行业怎么看
主流叙事是"算力不够就买最新的 H100、B200"。这个帖子提供了另一面:算力的瓶颈很大程度上在软件层,而不是硬件层。社区里有人补充类似思路——比如 llama.cpp(另一种轻量级推理框架)的优化分支,能让家用显卡跑出接近数据中心的速度。
但也有反对声音:V100 显存只有 16G 或 32G,装不下当前主流的 70B 以上模型,做严肃生产仍然吃力;这种"老卡复活"更适合中小企业的私有部署场景,而不是云厂商的规模化服务。开源分支的稳定性、长期维护也是隐性成本,不能只看跑分。
对普通人的影响
对企业 IT:机房还在用 V100 甚至更老显卡的,不必急着报废重买,软件优化能让旧资产继续产生价值。
对个人职场:懂开源推理框架调优的人,会比单纯会调 API 的人更稀缺——尤其在 AI 落地"最后一公里"的位置。
对消费市场:当推理成本持续下行,最终会反映在 AI 服务的定价上,按 token(模型处理文字的最小单位)计费的 API 可能比现在更便宜。