ARTICLEAI 应用
长上下文压缩:在准确性、延迟和成本之间做可解释取舍
组合摘要、去重、结构化记忆和分层检索,避免把整库内容塞进上下文窗口。
TOPIC
共 6 篇文章
组合摘要、去重、结构化记忆和分层检索,避免把整库内容塞进上下文窗口。
建立离线数据集、在线反馈、链路追踪和成本指标,持续判断模型、提示词与检索改动是否真的变好。
设计样本清洗、去重、标注、分层切分和版本回放,避免微调后模型学到脏数据。
解决模型输出缺字段、类型漂移和半截 JSON 问题,让 AI 结果可以直接进入业务流程。
多模型网关的设计——OpenAI 兼容与 Anthropic 原生双协议的抽象、数据库里的密钥脱敏,以及一个"真发请求"的连通测试。
以在线对话接口为例,拆解动态批处理、KV Cache、排队和流式响应的容量边界。