本周 Reddit 上 LocalLLaMA 社区出现一个值得记一笔的进展:阿里 Qwen3.8 27B 模型刚发布,开源推理引擎 NInfer 当天完成适配,在单张 RTX 5090(消费级旗舰显卡)上跑出约 200 token/秒的生成速度。

这是什么

「token/秒」是大模型输出文字的速度单位,200 大致是实时生成的 2-3 倍,意味着模型一边想一边说,用户基本感觉不到卡顿。过去这个量级的能力,要么靠云端商业 API 按 token 计费,要么靠多张专业卡堆叠;现在被压到一张两万块的消费卡上。

更值得注意的是工程层面:NInfer 支持 8 个请求并发、共享分页缓存(一种让显存复用更高效的技术),并实现了比 vLLM 更完整的推测解码支持(speculative decoding,即先用小模型猜几个词再让大模型批量确认,压缩整体耗时)。这些是商业推理服务才有的能力,被一个社区项目做出来了。

行业怎么看

乐观派认为这是开源本地 AI 全面逼近商业 API 的信号。过去要花几毛钱调用一次的模型,现在能在一张消费卡上跑出可用速度,对数据敏感、成本敏感的企业是直接利好,也意味着「国产模型 + 国产硬件 + 开源推理」栈在工程层面已经走通。

但谨慎的声音同样存在。一位关注基础设施的从业者在评论区指出:200 token/秒是生成速度,首次响应延迟(用户发问到看到第一个字的时间)才是体验关键;NInfer 相比 vLLM、TensorRT-LLM 等成熟方案,工程稳定性、文档完备性、社区支持仍有明显差距,「能跑」和「能稳定服务几千人」是两件事。

另一层被忽略的风险是:这类进展高度依赖单一显卡型号(RTX 5090)。一旦硬件供应、价格或能效政策变化,今天的「低成本」优势会立刻消失。本地 AI 还没到可以无脑押注的阶段。

对普通人的影响

  • 对企业 IT:自建 AI 推理的硬件投入从「机房级」降到「工位级」,金融、医疗、法律等数据合规要求高的行业,值得重新评估私有化部署的成本表。
  • 对个人职场:非技术人员暂时无感;但如果你身边有懂技术的朋友,「帮我部署一个能用的本地 AI」正从折腾变成两小时内能搞定的事。
  • 对消费市场:短期无直接影响。但开源模型变强最终会传导到手机助手、智能音箱、车机等端侧场景,下一代嵌入式 AI 的流畅度会比现在明显提升。