ARTICLE / 2 MIN READ
模型蒸馏落地:把大模型能力迁移到更低成本的服务
设计教师模型标注、软标签、拒答保留、回归评测和灰度路由,降低推理成本而不牺牲安全。
蒸馏不是把大模型输出全部当成正确答案。教师模型可能产生幻觉、泄露敏感信息或在边界问题上不稳定,生成训练数据前要保留规则和人工质量门槛。
选择蒸馏任务
优先蒸馏格式稳定、边界清晰的分类、抽取和路由任务;复杂推理保留大模型兜底。样本记录教师模型版本、提示词、工具证据和置信度,低置信答案进入人工复核。
保留拒答和安全样本
训练集必须包含无答案、越权、提示注入、敏感信息和工具失败样本,学生模型不能只学习“如何回答”。输出经过隐私扫描、Schema 校验和业务规则校验后才进入训练。
对比成本与质量
评测同时看关键任务准确率、拒答准确率、格式通过率、长尾召回、首 token 延迟、GPU 利用率和每请求成本。学生模型达不到阈值时自动路由到教师模型,而不是静默返回低质量结果。
灰度和回滚
按任务类型和租户做影子流量,记录学生与教师差异。灰度期间出现高风险错误立即切回旧路由,蒸馏数据和模型别名都保留可追溯版本。
参考资料:NIST 生成式 AI 风险画像。
GITHUB DISCUSSION
评论与回复
评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。
评论区进入视口后自动加载。