ARTICLE / 2 MIN READ
长上下文压缩:在准确性、延迟和成本之间做可解释取舍
组合摘要、去重、结构化记忆和分层检索,避免把整库内容塞进上下文窗口。
上下文窗口变大不代表可以无限拼接资料。重复段落、过期版本和无关聊天会同时增加 token 成本和模型注意力负担,最终答案反而变差。
先做确定性压缩
对检索结果按文档 ID、段落哈希和版本去重,再按问题实体过滤无关章节。表格、时间线和指标优先转成结构化摘要,保留来源页码和更新时间,避免摘要丢失关键限定词。
分层而不是一次摘要
先用便宜模型生成文档级摘要,再在候选段落上做问题级压缩。复杂任务保留原文片段,简单问答只注入必要字段。每层记录压缩版本和原文引用,回答时仍能展开证据。
控制预算
为系统指令、用户问题、工具结果和检索上下文分配 token 预算,超过上限时按相关性、时效性和权限排序裁剪。预算变化要进入评测,不能只看平均 token 数。
监控压缩损失
比较压缩前后的召回覆盖、引用正确率、回答完整度、首 token 延迟和成本。发现关键字段丢失时回退到更高保真策略,并把样本加入回归集。
参考资料:OpenAI Evals 指南。
GITHUB DISCUSSION
评论与回复
评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。
评论区进入视口后自动加载。