ARTICLE / 2 MIN READ
AI 配额与限流:按 Token、并发和业务价值控制流量
为多租户 AI 应用设计令牌桶、并发槽位、预算和优先级,避免突发流量击穿模型服务。
AI 请求的成本和耗时差异很大,只按 QPS 限流会让一个长上下文请求和一个短分类请求占用同样的资源。配额要同时考虑请求数、输入输出 token、并发和预算。
多维度额度
租户配置每分钟请求数、并发数、输入 token、输出 token、日预算和模型白名单。功能级额度控制批量摘要、在线客服和后台报表,避免低优先级任务占满共享资源。
令牌桶和并发槽
入口用令牌桶限制速率,模型网关用并发槽限制正在生成的请求。超额请求按优先级排队、降级模型或返回可重试错误,排队时间超过预算时直接取消。
预算和幂等
预估 token 不足以覆盖工具重试和长输出,执行前预留额度,完成后按实际 usage 结算。请求带 idempotency_key,重试不会重复扣费或重复执行工具。
运营可见
展示租户使用量、剩余额度、排队时间、拒绝原因和成本趋势。告警要区分突发流量、异常循环、单个 prompt 膨胀和供应商限流,才能采取正确措施。
参考资料:OpenTelemetry 概念。
GITHUB DISCUSSION
评论与回复
评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。
评论区进入视口后自动加载。