本周 Reddit 的 LocalLLaMA 社区有个帖子火了:一位用户用一张英伟达 RTX 5090 消费级显卡,配合名为 Ninfer 的新推理引擎(让训练好的模型实际"运行"出结果的软件层)和一个经过特殊压缩的 Qwen3 8B 模型,跑出了平均 170、最高 220 tokens/秒的生成速度。tokens/秒是大模型吐字速度的单位,220 大约相当于流畅对话的 1.5 倍。作者说比他之前用的 llama.cpp(最主流的开源推理引擎)快了一倍多。
这是什么
推理引擎(也就是模型跑起来时的"调度软件")一直是大模型本地部署的瓶颈。过去两年,llama.cpp、vLLM、Ollama 等工具让普通开发者也能在自家机器上跑模型,但速度往往不如云端 API 顺滑。这次 Ninfer 的突破在于:它同时吃下了 5090 这代新显卡的硬件红利、Qwen3 自带的 MTP 多 token 预测能力(让模型一次猜多个字、再校验),以及 NVFP4 这种 4-bit 浮点压缩格式(把模型体积压到原来的四分之一左右、速度反而更快)。三者叠加,单卡体验直接翻倍。
行业怎么看
社区里有人跟着复现确认了数字,但也有人泼冷水:220 tokens/秒是峰值场景的成绩,而且需要把上下文窗口(模型一次能"看"多少字)开到 24 万这种极端设定,常规使用下可能只有七成。更重要的是,这套组合高度依赖 5090 这代新硬件和特定的模型压缩格式,不是"谁都能一键复制"的方案。但我们注意到一件更值得关心的事:硬件升级、推理优化、模型压缩这三股力量同时在加速,云端 API 的速度优势正在被蚕食——OpenAI、Anthropic 们过去靠"快"挣到的溢价,未来要打折扣。国内做模型、做显卡、做一体机的公司,都该重新算一遍这本账。
对普通人的影响
对企业 IT:原本按 token 给云端付钱的模型,现在一张一万多元的 5090 就能跑,企业敏感数据不用再上传第三方。
对个人职场:愿意折腾的白领未来可以在自己电脑上搭私人 AI 助手,对话内容不再被云端拿去训练。
对消费市场:AI 硬件和"一键部署"工具会越来越便宜,这是英伟达、联想、戴尔们的下一个增长故事。