TOPIC

# 语义缓存

共 2 篇文章

ARTICLEAgent 架构

高并发下的成本与延迟博弈:模型路由与多级缓存

大促把客服 Agent 的 QPS 从 50 顶到 5000,全调大模型烧钱、全调小模型答错。用网关层毫秒级路由、语义缓存和降级兜底链,在成本、延迟和正确率之间找平衡。

ARTICLEAI 应用

AI 语义缓存:降低重复推理成本但不牺牲正确性

设计语义相似阈值、租户隔离、答案新鲜度和缓存失效,让缓存真正适合业务问答。