KServeKnative
KServe 将推理服务扩缩容拆成三路,GPU 成本开始精打细算
KServe 用 KPA、HPA、KEDA 分别承接请求、基础资源和事件驱动的推理扩缩容。它值得关心,因为 AI 服务开始把 GPU 利用率当作经营问题,而非只追求模型上线。
3d ago·2 分钟
SageMaker HyperPodKarpenter
Best practices to run inference on Amazon SageMaker HyperPod
AWS 发布 HyperPod 推理部署最佳实践指南,称可将
GPU 工作负载的总拥有成本降低最高 40%。
Apr 15·2 分钟