ARTICLE / 2 MIN READ

LLM 结构化输出:从 JSON Schema 到业务可用结果

解决模型输出缺字段、类型漂移和半截 JSON 问题,让 AI 结果可以直接进入业务流程。

把模型回复直接解析成对象是很多 AI 功能的第一处事故。生产链路必须把生成、语法校验、业务校验和失败修复分开,每一步都返回可诊断的错误。

Schema 是接口契约

为字段定义类型、枚举、必填规则、长度、单位和嵌套结构,禁止把金额、日期和状态只描述在自然语言提示里。Schema 进入版本库,与模型和提示词版本绑定,变更需要兼容性检查。

两层校验

第一层验证 JSON 语法和 Schema,处理缺字段、额外字段和类型漂移;第二层验证业务约束,例如结束时间不能早于开始时间、总额必须等于明细之和。失败时保留原始输出摘要和校验路径,方便评测。

修复要有限度

轻微格式错误可以用确定性修复或一次重试;业务冲突不能无限让模型自修,应该回到补充信息或人工审核。重复提交同一个任务使用 idempotency_key,避免修复重试重复写库。

评测字段级质量

除了整体通过率,还要统计字段缺失率、类型错误率、业务校验失败率、重试率和人工修改率。上线门禁按关键字段设置阈值,确保新模型不会以“总分更高”换来关键字段变差。

参考资料:JSON Schema 规范

GITHUB DISCUSSION

评论与回复

评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。

评论区进入视口后自动加载。