TOPIC

# GPU

共 3 篇文章

ARTICLEAI 应用

AI FinOps:用 GPU 利用率和 Token 成本管理模型服务

把模型路由、批处理、缓存、队列和预算护栏接起来,让 AI 成本与质量、延迟一起可控。

ARTICLEAI 应用

AI GPU 调度:把显存、队列和任务优先级纳入资源管理

设计 GPU 资源池、碎片整理、优先级队列和抢占策略,提高模型服务的利用率与稳定性。

ARTICLEAI 应用

LLM 推理服务的批处理、流式输出与成本控制

以在线对话接口为例,拆解动态批处理、KV Cache、排队和流式响应的容量边界。