这是什么

Reddit 用户 okoyl3 这周分享了一组数据:他把开源推理引擎 Strata(把模型权重高效塞进硬件并生成文字的程序)深度改造后,跑在一台 2018 年的 IBM AC922 服务器上——两颗 POWER9 CPU 加四块 V100 显卡。配合量化(把模型参数从高精度压缩到低精度以省显存)后的 Qwen3.8-FN,预填充(模型"读完"输入)峰值 7,357 token/s,解码(模型"吐出"输出)约 113 token/s。作者表示部分改动会回馈社区。

行业怎么看

支持者认为这证明推理优化的空间还很大,「旧硬件 + 好软件」可能让企业 AI 部署成本大幅下降,尤其利好手握 POWER9 设备的传统行业。持保留意见的人指出:113 token/s 的解码速度只有 H100 同类模型的几十分之一;NVLink 2.0 70GB/s 带宽很快就会撞墙;这是单人实验,离生产环境要求的稳定性、并发和运维都还有距离。一个旧硬件新用法的 demo,不等于一个可上线方案。

对普通人的影响

  • 对企业 IT:手里还有旧 POWER9 集群的公司多了一条「先试试再换卡」的路径,但别急着投产——单人 demo 和生产部署之间隔着稳定性、并发和运维三道坎。
  • 对个人职场:暂不直接影响日常工作流,但开源推理引擎在变强,未来本地跑大模型的硬件门槛会继续降低。
  • 对消费市场:短期无直接影响;中长期可能间接压低云端 AI 推理的报价。