WRITING INDEX

文章与实践记录

写清楚为什么这样做,也保留没有成功的方法。

搜索文章
ARTICLEAgent 架构

招聘 Agent 跑了三天崩在半路:Checkpoint 该存什么、恢复怎样不重复扣费

长周期工作流的断点续传设计——检查点粒度、状态快照结构、持久化与不持久化的分界、幂等键与 outbox,让恢复重放不重复发邮件。

ARTICLEAgent 架构

重构与审查互相踢皮球:用全局状态机和 Router 仲裁死锁

两个 Agent 无限循环烧 Token 的根因不是跳数太多,而是没有仲裁者。用集中式状态机、结构化收敛信号和第三方裁决,从架构层杜绝踢皮球。

ARTICLEAgent 架构

财务 Agent 的三道纵深防御:当"忽略之前所有指令"撞上 execute_payment

Prompt 防御为什么必然失效,以及如何在代码层、API 网关层、执行层构建三道纵深防御,用 propose/confirm 两步拆分和异步人工确认回调守住转账这类不可逆动作。

ARTICLEAgent 架构

长上下文记忆与遗忘:陪伴型 Agent 的分层记忆架构

从写入触发到语义时间混合打分,拆解 Working/Short/Long-term 三层记忆如何让 Agent 记住"周二提到的那个地方"。

ARTICLEAgent 架构

销售部 Agent 绝不能看到 HR 薪资:企业级 Agent 的权限过滤与套话防御

全员共享一个知识 Agent 时,权限必须在 RAG 检索层用 Metadata Filtering 落地,而不是靠 Prompt 让模型"别看";配合 System Message 动态注入与不确认不否认的拒答,堵住多轮套话。

ARTICLEAgent 架构

高并发下的成本与延迟博弈:模型路由与多级缓存

大促把客服 Agent 的 QPS 从 50 顶到 5000,全调大模型烧钱、全调小模型答错。用网关层毫秒级路由、语义缓存和降级兜底链,在成本、延迟和正确率之间找平衡。

ARTICLEAgent 架构

RAG 评估与 Bad Case 自动化治理

用 LLM-as-a-Judge 自动打分、决策树自动归因、Golden Dataset 做 CI 回归,把每天几千条"答非所问"的日志变成可治理的流水线。

ARTICLEAgent 架构

RAG 混合检索与重排序实战

用意图识别、三路召回、RRF 融合和 cross-encoder 重排,破解制造业知识库里"手册说正常但实际过热"这类矛盾问题。

ARTICLEAgent 架构

架构决策:法律合同审查该用 RAG、微调还是 Long Context

从成本、延迟、准确性、可解释性、更新频率五维给出决策矩阵,并说清为什么合同审查最终要三者混合。

ARTICLEAgent 架构

工具调用的幻觉与边界控制:Schema、校验与错误状态机

Agent 会幻觉出不存在的工具、把 user_id 传成 null、查一次天气调十次。用 Schema 强约束、调用前校验、错误处理状态机和调用预算,把不可信的模型输出关进可控的边界里。

ARTICLEAI 应用

从零做一个企业知识库,我在这几个地方做了取舍

KnowFlow 复盘——模块化单体、三层存储分工、RRF 去重、ClickHouse 连不上的坑,以及一个开源项目该有的诚实边界。

ARTICLEAI 应用

AI Agent 记忆系统:短期上下文、长期事实与用户偏好的分层设计

解决 Agent 记忆膨胀、事实过期和跨用户污染问题,让记忆可检索、可撤回、可审计。

ARTICLEAI 应用

AI Agent 编排:把多智能体协作变成可恢复的工作流

设计路由、并行、审批、补偿和人工接管,让多 Agent 任务不依赖一条幸运的成功路径。

ARTICLEAI 应用

AI Agent 从演示到生产的状态机设计

把会调用工具的智能体拆成可观测、可重试、可暂停和可审计的业务流程。

ARTICLEAI 应用

AI 批量推理平台:让离线任务可暂停、可重试、可追踪

设计数据分片、任务队列、幂等输出、断点续跑和成本统计,支撑大规模离线生成与分类。

ARTICLEAI 应用

AI 代码审查助手:从评论生成到可验证变更

设计基于 diff、测试和仓库规范的代码审查 Agent,降低噪声并保证建议能够被验证。

ARTICLEAI 应用

多模态内容审核:规则、模型与人工复核的组合拳

设计文本、图片、音频和视频审核流水线,处理误杀、漏放、申诉和高峰积压。

ARTICLEAI 应用

长上下文压缩:在准确性、延迟和成本之间做可解释取舍

组合摘要、去重、结构化记忆和分层检索,避免把整库内容塞进上下文窗口。

ARTICLEAI 应用

AI Copilot 交互设计:让用户始终知道它在做什么

设计流式输出、引用、可撤回操作、人工接管和不确定性提示,提升 AI 功能的可控感和完成率。

ARTICLE安全工程

AI 数据隐私工程:从脱敏到租户隔离的完整边界

面向企业 AI 应用设计 PII 识别、最小化、保留期限、供应商策略和审计闭环,避免数据在链路中失控。

ARTICLEAI 应用

模型蒸馏落地:把大模型能力迁移到更低成本的服务

设计教师模型标注、软标签、拒答保留、回归评测和灰度路由,降低推理成本而不牺牲安全。

ARTICLEAI 应用

企业文档问答:从解析、引用到权限的闭环

设计面向合同、制度和手册的文档问答产品,保证回答可引用、可追溯、可拒答。

ARTICLEAI 应用

LLM 评测与可观测性:把一次回答变成可回归的工程指标

建立离线数据集、在线反馈、链路追踪和成本指标,持续判断模型、提示词与检索改动是否真的变好。

ARTICLEAI 应用

AI 用户反馈闭环:把点赞、编辑和申诉变成训练信号

设计显式反馈、隐式行为、标注队列和隐私边界,让线上反馈可用于评测和产品迭代。

ARTICLEAI 应用

大模型微调数据工程:从原始对话到可训练样本

设计样本清洗、去重、标注、分层切分和版本回放,避免微调后模型学到脏数据。

ARTICLEAI 应用

AI FinOps:用 GPU 利用率和 Token 成本管理模型服务

把模型路由、批处理、缓存、队列和预算护栏接起来,让 AI 成本与质量、延迟一起可控。

ARTICLEAI 应用

AI GPU 调度:把显存、队列和任务优先级纳入资源管理

设计 GPU 资源池、碎片整理、优先级队列和抢占策略,提高模型服务的利用率与稳定性。

ARTICLEAI 应用

AI 事故响应:把幻觉、越权和成本异常纳入值班手册

建立 AI 事故分级、证据保全、快速降级、回滚和复盘流程,缩短从发现到止损的时间。

ARTICLEAI 应用

AI 推理网关:用 Kubernetes 原生流量治理承接模型服务

结合模型池、队列、优先级和 Gateway API 推理扩展,解决多模型路由与 GPU 服务发现问题。

ARTICLEAI 应用

LoRA 适配器服务化:多租户模型个性化的隔离与切换

讨论适配器注册、加载、显存缓存、租户隔离和回滚,支撑低成本的领域模型定制。

ARTICLEAI 应用

AI 模型线上监控:质量、漂移和供应商健康度一起看

建立模型质量代理指标、数据漂移、延迟、成本和供应商故障监控,避免只看到 CPU 正常。

ARTICLEAI 应用

AI 模型路由网关:按任务、成本和合规选择模型

建立统一模型入口、能力注册、预算、区域策略和故障切换,避免业务代码绑定单一供应商。

ARTICLEAI 应用

AI Guardrails:把输入、输出和工具动作放进同一条安全链

组合内容策略、提示注入防护、输出校验和工具沙箱,降低开放式 AI 功能的越权风险。

ARTICLEAI 应用

Prompt 发布工程:像管理代码一样管理提示词

建立提示词版本、变量契约、离线评测、灰度和一键回滚,避免线上偷偷变质。

ARTICLEAI 应用

RAG 评测体系:同时衡量召回、引用和最终回答

建立可重复的 RAG 评测集,拆解检索和生成误差,避免只看一个模糊的满意度分数。

ARTICLEAI 应用

多租户 RAG:把权限过滤放在召回之前

设计租户隔离、文档 ACL、向量索引和缓存键,避免相似度检索把别的客户资料带进回答。

ARTICLEAI 应用

AI 配额与限流:按 Token、并发和业务价值控制流量

为多租户 AI 应用设计令牌桶、并发槽位、预算和优先级,避免突发流量击穿模型服务。

ARTICLEAI 应用

实时语音 Agent:音频流、打断和工具调用的状态管理

设计语音输入输出、VAD、打断、延迟预算和工具动作,支撑客服、陪练和语音助手场景。

ARTICLEAI 应用

AI 推荐系统:候选召回、排序和探索如何闭环

用多路候选、特征新鲜度、在线重排和探索策略搭建可解释的推荐链路。

ARTICLEAI 应用

AI 语义缓存:降低重复推理成本但不牺牲正确性

设计语义相似阈值、租户隔离、答案新鲜度和缓存失效,让缓存真正适合业务问答。

ARTICLEAI 应用

语义搜索排序:从向量召回到业务重排

设计混合召回、字段权重、交叉编码器重排和点击反馈,让 AI 搜索真正服务业务任务。

ARTICLEAI 应用

AI 流式响应:从首 token 到可取消的产品体验

设计 SSE 流、增量事件、断线重连、取消和最终一致性,避免用户看到半截答案却无法判断状态。

ARTICLEAI 应用

LLM 结构化输出:从 JSON Schema 到业务可用结果

解决模型输出缺字段、类型漂移和半截 JSON 问题,让 AI 结果可以直接进入业务流程。

ARTICLEAI 应用

AI 合成数据:从场景生成到质量与隐私验证

为风控、客服和测试生成可控的合成数据,处理分布相似、隐私泄露和业务边界覆盖问题。

ARTICLEAI 应用

AI 工具权限引擎:给每次函数调用加上策略、审批和审计

为 Agent 工具调用建立 RBAC、ABAC、风险分级和一次性授权,避免模型成为绕过业务权限的入口。

ARTICLE工程实践

API 契约治理:用兼容性规则避免前后端互相等待

结合 OpenAPI、JSON Schema、契约测试和版本策略,让接口变更可预览、可验证、可回滚。

ARTICLE高并发

高并发系统从单体到分层的演进路线

用容量模型、流量分层和故障边界拆解一个业务如何从单体应用平稳走向高并发架构。

ARTICLE云原生

eBPF 与 OpenTelemetry:低侵入构建统一可观测链路

组合内核级网络观测与应用级 trace、metric、log,解决服务拓扑、采样和高基数标签的落地问题。

ARTICLE云原生

Edge Wasm 运行时:把轻量计算推到离用户更近的地方

讨论 WebAssembly 组件在边缘网关中的沙箱、冷启动、ABI、配置分发和可观测性设计。

ARTICLE云原生

Kubernetes 事件驱动扩缩容:HPA 与 KEDA 的边界怎么划

以 CPU、队列长度和业务事件为信号设计自动扩缩容,处理冷启动、下游容量和缩容抖动。

ARTICLEAI 应用

把 15 家大模型做成后台可配置:一个 ChatClient 接口的两种方言

多模型网关的设计——OpenAI 兼容与 Anthropic 原生双协议的抽象、数据库里的密钥脱敏,以及一个"真发请求"的连通测试。

ARTICLEAI 应用

多模态文档流水线:从 OCR 到可追溯知识库

设计 PDF、图片、表格混合输入的异步处理链,让抽取结果可校验、可回放、可定位到原文。

ARTICLE云原生

平台工程 IDP:用软件目录和黄金路径降低交付摩擦

从服务目录、模板、环境自助和指标治理出发,搭建真正能被研发使用的内部开发平台。

ARTICLE数据工程

PostgreSQL 逻辑复制与 CDC:从复制槽到下游重放

处理逻辑复制槽、WAL 保留、DDL 变化、重复事件和故障切换,构建可恢复的变更数据链路。

ARTICLE实时系统

Prometheus Remote Write 扩展:高基数指标下的背压与降本

处理远程写入的 WAL、分片、重试和背压,避免监控系统在流量高峰时反过来拖慢业务节点。

ARTICLE数据工程

实时特征平台:把 CDC、在线查询和离线回放接成一条链

设计低延迟特征写入、点时间正确性、回填和线上线下一致性,支撑推荐、风控和营销决策。

ARTICLEAI 应用

十万级文档的知识库,为什么用 RediSearch 而不是 Elasticsearch

知识库场景下用 RediSearch 替代 Elasticsearch 的五条理由,以及它扛不住的边界。

ARTICLE安全工程

软件供应链安全:让每个上线制品都能证明来源

从 SBOM、构建来源、签名到集群准入,搭建可验证、可追溯、可撤销的软件供应链。

ARTICLE实时系统

WebTransport 实时系统:在 WebSocket 之外选择可靠性

对比 WebSocket 与 WebTransport 的连接、流、无序数据报和重连模型,为协同、游戏和实时看板选择合适传输层。

ARTICLE安全工程

SPIFFE 工作负载身份:替代长期密钥的服务间认证方案

用可轮换的工作负载身份和短期 SVID 建立服务间 mTLS,逐步迁移硬编码密钥和共享账号。

ARTICLE高并发

QPS、并发数与响应时间的容量估算方法

用 Little 定律和分层容量表,把“系统能扛多少流量”变成可以验证的数字。

ARTICLEAI 应用

MCP 服务接入的权限、审批与审计

以远程 MCP 服务为例,设计工具授权、数据边界和高风险操作的安全闭环。

ARTICLE高并发

高并发缓存设计的四个故障陷阱

通过缓存穿透、击穿、雪崩和热点 Key 的实战策略,建立可恢复的缓存层。

ARTICLEAI 应用

RAG 检索增强生成的数据管道怎么做

从文档切分、权限过滤、混合检索到引用评估,搭建可持续更新的 RAG 知识库。

ARTICLEAI 应用

LLM 推理服务的批处理、流式输出与成本控制

以在线对话接口为例,拆解动态批处理、KV Cache、排队和流式响应的容量边界。

ARTICLE高并发

Redis 在高并发系统中的锁、限流与幂等

以订单接口为例,梳理 Redis 分布式锁、滑动窗口限流、幂等键和延迟任务的边界。

ARTICLE高并发

数据库在高并发下的连接池、读写分离与分片

从慢查询和连接耗尽出发,给出关系型数据库逐级扩展的判断标准与迁移步骤。

ARTICLEAI 应用

向量检索 HNSW 与 IVFFlat 怎么选

以 pgvector 为例,解释近似检索的召回率、索引构建、过滤条件和线上调参。

ARTICLE高并发

消息队列如何给高并发链路削峰

以订单通知和库存同步为例,说明分区、确认、重试、死信与重复消费应该如何组合。

ARTICLE高并发

秒杀系统如何防止超卖与重复下单

从预热、限流、库存扣减到异步下单,拆解高峰抢购链路的关键状态和一致性边界。

ARTICLE高并发

高并发接口的限流熔断降级与隔离

用稳定性预算设计超时、重试、熔断、舱壁和降级,避免级联故障。

ARTICLE高并发

订单支付库存的一致性如何落地

用状态机、Outbox 和补偿任务处理跨服务写入,避免把分布式事务变成不可调试的黑盒。

ARTICLE数据工程

RediSearch 会不会保存结果集?

从索引、查询执行和游标三个层面,解释 RediSearch 到底保存了什么。

ARTICLE大数据

大数据系统如何选择 OLTP、OLAP 与湖仓

从数据访问模式、延迟和成本出发,梳理业务库、分析库、数据湖和湖仓的职责边界。

ARTICLE大数据

ODS、DWD、DWS、ADS 数据分层与建模

用数据分层、粒度和指标口径解决重复加工、口径不一致和报表难以回溯的问题。

ARTICLE工程实践

Git Worktree 和复制项目文件夹有什么区别?

两种多分支并行方式看起来相似,但在对象复用、分支安全和维护成本上完全不同。

ARTICLE大数据

Kafka 加 Flink 构建实时数仓的关键细节

讲清事件时间、窗口、状态、乱序和 Exactly-once,避免实时指标看似及时却无法对账。

ARTICLE大数据

ClickHouse 明细表与聚合表的建模实践

从分区、排序键、索引粒度和物化视图出发,设计高吞吐写入与低延迟分析查询。

ARTICLE大数据

Spark 与 Hive 批处理如何控制小文件和数据倾斜

从分区规划、文件格式、Shuffle 和 AQE 讲解离线任务的性能与稳定性。

ARTICLE大数据

宽表存储如何承载高写入与海量明细

对比 HBase、Cassandra 一类宽列存储的行键、列族、热点和查询建模方法。

ARTICLE大数据

对象存储数据湖的文件格式与表格式选择

讲解 Parquet、ORC、Iceberg、Hudi 和 Delta 在压缩、Schema 演进与更新场景中的取舍。

ARTICLE大数据

搜索索引、结果集缓存与海量数据检索

从倒排索引、分页、聚合和缓存失效出发,设计可扩展的搜索服务。

ARTICLE大数据

大数据平台的数据质量与可回补设计

把完整性、唯一性、及时性和对账变成每个批次都能执行的质量门禁。

ARTICLE大数据

海量数据的冷热分层、压缩与生命周期管理

从存储成本、查询热度、保留期限和恢复目标出发,设计可持续的大数据存储策略。

ARTICLE高并发

API 网关的高并发路由与连接管理

从连接复用、鉴权缓存、限流和路由灰度出发,搭建承接流量的第一道稳定边界。