ARTICLE / 2 MIN READ
大模型微调数据工程:从原始对话到可训练样本
设计样本清洗、去重、标注、分层切分和版本回放,避免微调后模型学到脏数据。
微调效果差往往不是模型不够大,而是训练样本重复、答案风格不一致、评测集泄露或关键场景缺失。数据工程要先保证样本的来源和分布,再讨论训练参数。
清洗和规范化
去除秘密、PII、系统提示和无关附件,统一角色、工具调用和引用格式。长对话按任务切分,保留用户目标、必要上下文、正确答案和拒答条件,删除猜测性中间输出。
去重和质量分层
按文本哈希和语义相似度去重,标记人工确认、弱监督和模型生成来源。样本按意图、难度、语言、租户和风险分层,低质量和重复样本不能占满训练集。
切分避免泄露
同一用户、同一文档和同一业务事件只能进入一个 split。评测集冻结并独立存储,训练前检查近邻相似度和答案泄露。每个版本生成清单、摘要、统计和变更报告。
训练后回放
微调完成后用旧模型和新模型跑同一评测集,比较事实、格式、安全、成本和拒答。发现某类样本明显回归时,定位到数据版本而不是盲目增加训练轮数。
参考资料:OpenAI Evals 指南。
GITHUB DISCUSSION
评论与回复
评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。
评论区进入视口后自动加载。