TOPIC

# 推理服务

共 3 篇文章

ARTICLEAI 应用

AI GPU 调度:把显存、队列和任务优先级纳入资源管理

设计 GPU 资源池、碎片整理、优先级队列和抢占策略,提高模型服务的利用率与稳定性。

ARTICLEAI 应用

AI 推理网关:用 Kubernetes 原生流量治理承接模型服务

结合模型池、队列、优先级和 Gateway API 推理扩展,解决多模型路由与 GPU 服务发现问题。

ARTICLEAI 应用

LLM 推理服务的批处理、流式输出与成本控制

以在线对话接口为例,拆解动态批处理、KV Cache、排队和流式响应的容量边界。