ARTICLE / 2 MIN READ

AI GPU 调度:把显存、队列和任务优先级纳入资源管理

设计 GPU 资源池、碎片整理、优先级队列和抢占策略,提高模型服务的利用率与稳定性。

GPU 调度的瓶颈经常不是算力不足,而是显存被不同大小的模型切成碎片,在线请求和离线任务互相争抢。资源平台要同时管理 GPU 数量、显存、模型缓存和任务 SLA。

资源以能力描述

节点标签记录 GPU 型号、显存、互联拓扑、驱动和可用区域。任务声明模型大小、最大 batch、上下文长度、优先级和可接受的冷启动时间,调度器据此选择节点而不是只看 CPU。

预热和缓存

热门模型保持热实例,冷门模型按队列动态加载。模型权重使用内容摘要和本地缓存,预热过程有超时和取消;节点回收前清理临时文件并保留最小审计信息。

在线和离线隔离

在线推理使用保底配额,离线评测进入可抢占队列。抢占前保存任务 checkpoint,恢复后继续而不是从头开始。任何任务都设置显存、时长和输出上限,防止单个租户占满资源池。

指标和成本

看 GPU 利用率、显存利用率、空转时间、排队等待、冷启动、抢占次数、每百万 token 成本和任务完成率。利用率升高但 TTFT 变差时,应优先增加隔离或扩容,而不是继续压缩资源。

参考资料:Kubernetes 推理流量扩展

GITHUB DISCUSSION

评论与回复

评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。

评论区进入视口后自动加载。