我们注意到一组数字:GitHub 用户 curvedinf 用 4 张二手 AMD MI100 显卡(整机约 6500 美元)跑阿里 Qwen3 27B 模型,token 生成速度从原版 vLLM 的 15 token/s 拉到 972 token/s,提升约 65 倍;批量处理达到 5,680 token/s。这不是企业工程,而是个人分支项目。我们的判断是:这件事的信号不在"又一个 vLLM 分叉(开发者基于开源代码做的独立分支)",而在它大幅压低了"跑得起一个像样大模型"的硬件门槛。

这是什么

vLLM 是当下主流的开源大模型推理(让模型对外提供问答服务)框架,但作者指出它对 INT8(一种用 8 比特整数代替 16/32 比特浮点的低精度计算格式,速度更快、占用更小,但在老硬件上几乎不被支持)支持"到处都是洞"。curvedinf 的工作就是把这些洞一个个补上:INT8 的矩阵乘法库、INT8 的 KV 缓存(推理时模型用来"记住"上下文的中间存储)、INT8 版本的注意力机制(模型决定"看哪段输入"的核心模块)、自定义的跨卡通信——整套链路在一台 4 张 MI100 的机器上跑通。

MI100 是 AMD 大约 4 年前的加速卡,没有原生 FP8(更先进的 8 比特浮点格式)。作者的方案本质是"让没有 FP8 的硬件继续好用",并明确说代码可移植到 MI50、MI210 以及部分老 Nvidia 卡。

行业怎么看

支持者会把它当作"AI 不再被几家芯片商锁死"的实证。对预算敏感的企业、对数据合规要求高的行业(金融、医疗、政务),能本地、低成本、批量跑一个 27B 模型,是过去不敢想的事。

我们也想指出它的反面:这是单人维护的代码,没有商业支持;目前只在 Qwen3 上"被认真打磨",其它模型只是理论可移植;benchmark(基准测试)漂亮不等于生产环境的 SLA(服务水平协议,厂商对稳定性、响应速度的书面承诺)达标。社区里也有人指出,INT8 在长上下文、复杂推理下的精度损失虽小,但量化数据并不充分。值得兴奋,但距离"可以直接上生产"还有距离。

对普通人的影响

对企业 IT:"自建推理集群"过去是百万级预算。现在 10 万元以内可以搭出一个能用的 27B 部署节点,但前提是有工程师愿意读源码、踩坑、调优。

对个人职场:"本地能跑一个大模型"正在从极客玩具向普通技术岗位迁移。懂这套链路的人在企业内部会越来越值钱,反过来单纯调 API 的岗位溢价会缩水。

对消费市场:短期 C 端用户感受不大,大家还是用云端。中长期,"小模型本地跑、大模型云端跑"的双层格局会更清晰,本地 AI 助手类产品的硬件成本会继续下探。