ARTICLE / 2 MIN READ
LLM 结构化输出:从 JSON Schema 到业务可用结果
解决模型输出缺字段、类型漂移和半截 JSON 问题,让 AI 结果可以直接进入业务流程。
把模型回复直接解析成对象是很多 AI 功能的第一处事故。生产链路必须把生成、语法校验、业务校验和失败修复分开,每一步都返回可诊断的错误。
Schema 是接口契约
为字段定义类型、枚举、必填规则、长度、单位和嵌套结构,禁止把金额、日期和状态只描述在自然语言提示里。Schema 进入版本库,与模型和提示词版本绑定,变更需要兼容性检查。
两层校验
第一层验证 JSON 语法和 Schema,处理缺字段、额外字段和类型漂移;第二层验证业务约束,例如结束时间不能早于开始时间、总额必须等于明细之和。失败时保留原始输出摘要和校验路径,方便评测。
修复要有限度
轻微格式错误可以用确定性修复或一次重试;业务冲突不能无限让模型自修,应该回到补充信息或人工审核。重复提交同一个任务使用 idempotency_key,避免修复重试重复写库。
评测字段级质量
除了整体通过率,还要统计字段缺失率、类型错误率、业务校验失败率、重试率和人工修改率。上线门禁按关键字段设置阈值,确保新模型不会以“总分更高”换来关键字段变差。
参考资料:JSON Schema 规范。
GITHUB DISCUSSION
评论与回复
评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。
评论区进入视口后自动加载。