ARTICLE / 2 MIN READ
AI 合成数据:从场景生成到质量与隐私验证
为风控、客服和测试生成可控的合成数据,处理分布相似、隐私泄露和业务边界覆盖问题。
合成数据不是把真实数据喂给模型再随机改几个字段。它需要明确用途、约束和验收指标,否则生成的数据既不真实,也可能复现原始隐私。
先定义用途
测试数据关注字段约束和边界组合,模型训练关注分布和标签质量,风控演练关注稀有事件覆盖。不同用途使用不同生成器和保留策略,不能用同一套数据满足全部目标。
约束生成
把金额、时间、状态转换和跨表关联写成规则,模型只生成规则允许的字段。先生成结构化骨架,再生成文本或备注,最后运行唯一性、范围、引用完整性和业务状态机校验。
隐私和相似度
生成前做 PII 脱敏,生成后做近邻相似度、唯一片段、姓名地址组合和成员推断检查。高相似样本丢弃或重新采样,原始数据映射表与生成结果分开存储。
可重复与可撤销
记录 seed、生成器版本、约束版本和数据集摘要,保证一次实验可以复现。数据集带用途、租户和过期时间,过期同步清理缓存、下载副本和评测环境。
参考资料:NIST AI 风险管理框架。
GITHUB DISCUSSION
评论与回复
评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。
评论区进入视口后自动加载。