一家每周处理 240 万次临床对话的 AI 公司 Heidi Health,本周把跑语音识别的 GPU 从 16 台压到 4 台、节省 75% 算力——这是 AI 行业重心从模型转向推理成本的最新信号。
这是什么
Heidi 是一家临床陪诊 AI 公司,每周处理 240 万次医患对话,覆盖 190 个国家。它把语音转文字(ASR,自动语音识别)用的是 NVIDIA 微调过的 Parakeet TDT 0.6B V2 模型,跑在 L40S GPU 上。一次识别请求只用 GPU 15–20% 算力,剩下 80% 空转;默认的「时间分片」让多个请求排队轮流使用 GPU,切换还有额外开销。AWS 与 NVIDIA 的解法是用 MPS(Multi-Process Service,多进程服务)——把一块 GPU 同时分给多个进程跑,配合 Triton 推理服务器做请求调度。同样并发量下,GPU 数量从 16 台降到 4 台,平均延迟 650 毫秒内,99 分位不超过 1 秒。
行业怎么看
AWS 与 NVIDIA 在联合博客里说得很直白:这是工程胜利,不是算法胜利。它的意义在于,模型能力趋于同质时,谁能压低推理成本,谁就在合同里多出几个点的毛利空间。但我们也要看到限制:MPS 让多进程共享 GPU,代价是隔离性下降——一个进程卡住可能波及他人,医疗这种对稳定性敏感的领域,部署时需要更复杂的容错设计,省下来的钱会被工程复杂度部分抵消。更大的趋势是,行业重心从「能不能训练出好模型」转向「能不能便宜地跑起来」。我们判断:未来 2–3 年,推理框架、GPU 调度、量化压缩等基础设施层的优化,会比模型本身的进步更直接影响 AI 项目的 ROI(投入产出比)。
对普通人的影响
- 对企业 IT:AI 项目算力预算可以更激进,但前提是团队里有人懂 GPU 调度和推理优化,光靠采购解决不了。
- 对个人职场:会 Triton、量化部署这类技能的工程师明显溢价,传统后端转 AI 推理岗是当下性价比最高的转型路径之一。
- 对消费市场:AI 客服、AI 医疗、AI 会议记录这类产品的终端价格,可能随推理成本下降而松动。