招聘 Agent 跑了三天崩在半路:Checkpoint 该存什么、恢复怎样不重复扣费
长周期工作流的断点续传设计——检查点粒度、状态快照结构、持久化与不持久化的分界、幂等键与 outbox,让恢复重放不重复发邮件。
WRITING INDEX
写清楚为什么这样做,也保留没有成功的方法。
长周期工作流的断点续传设计——检查点粒度、状态快照结构、持久化与不持久化的分界、幂等键与 outbox,让恢复重放不重复发邮件。
两个 Agent 无限循环烧 Token 的根因不是跳数太多,而是没有仲裁者。用集中式状态机、结构化收敛信号和第三方裁决,从架构层杜绝踢皮球。
Prompt 防御为什么必然失效,以及如何在代码层、API 网关层、执行层构建三道纵深防御,用 propose/confirm 两步拆分和异步人工确认回调守住转账这类不可逆动作。
从写入触发到语义时间混合打分,拆解 Working/Short/Long-term 三层记忆如何让 Agent 记住"周二提到的那个地方"。
全员共享一个知识 Agent 时,权限必须在 RAG 检索层用 Metadata Filtering 落地,而不是靠 Prompt 让模型"别看";配合 System Message 动态注入与不确认不否认的拒答,堵住多轮套话。
大促把客服 Agent 的 QPS 从 50 顶到 5000,全调大模型烧钱、全调小模型答错。用网关层毫秒级路由、语义缓存和降级兜底链,在成本、延迟和正确率之间找平衡。
用 LLM-as-a-Judge 自动打分、决策树自动归因、Golden Dataset 做 CI 回归,把每天几千条"答非所问"的日志变成可治理的流水线。
Agent 会幻觉出不存在的工具、把 user_id 传成 null、查一次天气调十次。用 Schema 强约束、调用前校验、错误处理状态机和调用预算,把不可信的模型输出关进可控的边界里。
KnowFlow 复盘——模块化单体、三层存储分工、RRF 去重、ClickHouse 连不上的坑,以及一个开源项目该有的诚实边界。
多模型网关的设计——OpenAI 兼容与 Anthropic 原生双协议的抽象、数据库里的密钥脱敏,以及一个"真发请求"的连通测试。
知识库场景下用 RediSearch 替代 Elasticsearch 的五条理由,以及它扛不住的边界。