ARTICLE / 2 MIN READ

大模型微调数据工程:从原始对话到可训练样本

设计样本清洗、去重、标注、分层切分和版本回放,避免微调后模型学到脏数据。

微调效果差往往不是模型不够大,而是训练样本重复、答案风格不一致、评测集泄露或关键场景缺失。数据工程要先保证样本的来源和分布,再讨论训练参数。

清洗和规范化

去除秘密、PII、系统提示和无关附件,统一角色、工具调用和引用格式。长对话按任务切分,保留用户目标、必要上下文、正确答案和拒答条件,删除猜测性中间输出。

去重和质量分层

按文本哈希和语义相似度去重,标记人工确认、弱监督和模型生成来源。样本按意图、难度、语言、租户和风险分层,低质量和重复样本不能占满训练集。

切分避免泄露

同一用户、同一文档和同一业务事件只能进入一个 split。评测集冻结并独立存储,训练前检查近邻相似度和答案泄露。每个版本生成清单、摘要、统计和变更报告。

训练后回放

微调完成后用旧模型和新模型跑同一评测集,比较事实、格式、安全、成本和拒答。发现某类样本明显回归时,定位到数据版本而不是盲目增加训练轮数。

参考资料:OpenAI Evals 指南

GITHUB DISCUSSION

评论与回复

评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。

评论区进入视口后自动加载。