TOPIC

# 模型服务

共 2 篇文章

ARTICLEAI 应用

AI FinOps:用 GPU 利用率和 Token 成本管理模型服务

把模型路由、批处理、缓存、队列和预算护栏接起来,让 AI 成本与质量、延迟一起可控。

ARTICLEAI 应用

LoRA 适配器服务化:多租户模型个性化的隔离与切换

讨论适配器注册、加载、显存缓存、租户隔离和回滚,支撑低成本的领域模型定制。