ARTICLE / 2 MIN READ

AI 模型线上监控:质量、漂移和供应商健康度一起看

建立模型质量代理指标、数据漂移、延迟、成本和供应商故障监控,避免只看到 CPU 正常。

传统服务的 200 状态并不能说明 AI 功能正常。模型可能返回格式合法但事实错误,输入分布可能发生变化,供应商也可能悄悄增加延迟或限流。

质量代理指标

根据任务记录 Schema 通过率、引用覆盖、拒答准确、用户修改、重试、人工接管和完成率。对没有即时标签的场景,使用抽样人工评分、规则校验和用户后续行为做代理,明确它们的局限。

数据和概念漂移

按意图、语言、租户和输入长度统计分布,监控新词、空结果、长尾问题和敏感内容比例。漂移超过阈值时触发评测和人工检查,不直接自动换模型。

系统与供应商指标

记录 TTFT、TPOT、P95/P99、错误码、限流、token、GPU 秒数和缓存命中。多供应商场景把可用性、区域和价格纳入健康评分,路由切换要可解释。

看板和告警

质量告警要能跳到样本、版本和链路;成本告警要能定位到租户、功能和 prompt。每次发布保留基线,支持按版本比较和一键回滚。

参考资料:OpenTelemetry 文档

GITHUB DISCUSSION

评论与回复

评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。

评论区进入视口后自动加载。