NVIDIADynamo
NVIDIA 让大模型服务崩了后几秒就恢复 — 但前提是用它的卡
NVIDIA 给自家推理框架 Dynamo 加上「影子引擎恢复」:单个推理节点崩溃后,恢复时间从几分钟压到几秒。对正在把 AI 部署到生产线的传统企业,这是一则好消息,也是一则关于算力绑定的提醒。
4d ago·2 分钟
vLLMServiceNow
vLLM 升级 V1 让强化学习结果跑偏 — 推理框架的正确性比速度更值得关心
vLLM 从 V0 升级到 V1 后,在强化学习场景下出现输出不一致的问题。推理框架的「快」如果以牺牲「准」为代价,会让依赖它训练的模型悄悄走偏。
May 6·2 分钟