这是什么
本周阿里通义千问在英伟达 GB300 NVL72 整机柜(72 张 GPU 互联)上跑出两个数字——每张 GPU 每秒 4000 tokens、单用户端每秒 350 tokens。这意味着大模型推理的边际成本正在被快速压低。
Qwen3 这版 2.4 万亿参数模型发布当天就在新硬件上完成优化,英伟达官方博客原文称为 "Day 0" 支持——无需额外调参。理解 350 tokens/秒的感受很简单:用户按下回车的瞬间,模型就开始吐字。
行业怎么看
正面:英伟达亲自挂名做 benchmarks(性能基准测试),发文配合发布,证明这是芯片厂与中国大模型团队的深度协同,开源社区对"国产模型 + 美国顶级算力"组合的天花板继续上抬。
反对意见值得记下。其一,288k tokens/s 是 FP8 精度(用 8 位浮点数压缩权重、牺牲一点精度换速度)的成果,金融、医疗等容错低的场景不能直接照搬。其二,GB300 单机柜采购价百万美元级,只有大厂和云厂商玩得起,中小企业自建门槛被抬到天上。其三,速度不等于便宜——电费、折旧一并算下来,TCO(总拥有成本)才是真账目,开源生态再热闹,最后掏钱买单的还是那几家超大规模云。
对普通人的影响
- 对企业 IT:自建推理集群的硬件门槛两年内从"几十万"抬到"几百万",中小企业直接租云比买机器更划算的趋势会加速。
- 对个人职场:用 AI 做长文档总结、代码生成这类高 token 消耗任务时,响应延迟会更接近"打字速度",工作流被频繁打断的体验会减少。
- 对消费市场:C 端 AI 订阅产品的涨价空间被压缩,2026 年订阅式服务(ChatGPT Plus、阿里通义、文小言等)大概率进入一轮价格战。