ARTICLE / 2 MIN READ
AI GPU 调度:把显存、队列和任务优先级纳入资源管理
设计 GPU 资源池、碎片整理、优先级队列和抢占策略,提高模型服务的利用率与稳定性。
GPU 调度的瓶颈经常不是算力不足,而是显存被不同大小的模型切成碎片,在线请求和离线任务互相争抢。资源平台要同时管理 GPU 数量、显存、模型缓存和任务 SLA。
资源以能力描述
节点标签记录 GPU 型号、显存、互联拓扑、驱动和可用区域。任务声明模型大小、最大 batch、上下文长度、优先级和可接受的冷启动时间,调度器据此选择节点而不是只看 CPU。
预热和缓存
热门模型保持热实例,冷门模型按队列动态加载。模型权重使用内容摘要和本地缓存,预热过程有超时和取消;节点回收前清理临时文件并保留最小审计信息。
在线和离线隔离
在线推理使用保底配额,离线评测进入可抢占队列。抢占前保存任务 checkpoint,恢复后继续而不是从头开始。任何任务都设置显存、时长和输出上限,防止单个租户占满资源池。
指标和成本
看 GPU 利用率、显存利用率、空转时间、排队等待、冷启动、抢占次数、每百万 token 成本和任务完成率。利用率升高但 TTFT 变差时,应优先增加隔离或扩容,而不是继续压缩资源。
参考资料:Kubernetes 推理流量扩展。
GITHUB DISCUSSION
评论与回复
评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。
评论区进入视口后自动加载。