找到 1 篇关于此标签的文章
KServe 用 KPA、HPA、KEDA 分别承接请求、基础资源和事件驱动的推理扩缩容。它值得关心,因为 AI 服务开始把 GPU 利用率当作经营问题,而非只追求模型上线。