ARTICLE / 2 MIN READ

AI 合成数据:从场景生成到质量与隐私验证

为风控、客服和测试生成可控的合成数据,处理分布相似、隐私泄露和业务边界覆盖问题。

合成数据不是把真实数据喂给模型再随机改几个字段。它需要明确用途、约束和验收指标,否则生成的数据既不真实,也可能复现原始隐私。

先定义用途

测试数据关注字段约束和边界组合,模型训练关注分布和标签质量,风控演练关注稀有事件覆盖。不同用途使用不同生成器和保留策略,不能用同一套数据满足全部目标。

约束生成

把金额、时间、状态转换和跨表关联写成规则,模型只生成规则允许的字段。先生成结构化骨架,再生成文本或备注,最后运行唯一性、范围、引用完整性和业务状态机校验。

隐私和相似度

生成前做 PII 脱敏,生成后做近邻相似度、唯一片段、姓名地址组合和成员推断检查。高相似样本丢弃或重新采样,原始数据映射表与生成结果分开存储。

可重复与可撤销

记录 seed、生成器版本、约束版本和数据集摘要,保证一次实验可以复现。数据集带用途、租户和过期时间,过期同步清理缓存、下载副本和评测环境。

参考资料:NIST AI 风险管理框架

GITHUB DISCUSSION

评论与回复

评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。

评论区进入视口后自动加载。