大模型微调数据应该如何清洗、去重和配比?
先用自己的话答,再看参考说法
60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。
别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。
参考内容当前已显示;开始口述后会暂时隐藏。
面试时怎么答
把“好数据”与目标能力绑定,而不是泛泛说清洗。可以沿格式可用、指令与回答相关、事实正确、难度与领域覆盖、安全合规、重复程度六个维度展开,再讲采样配比。
面试官可能问 LLM Judge 能否全自动。说明它适合扩大筛选规模,但会偏爱特定文风并继承模型盲点,需要规则、去重、分层人工抽检和真实验证集共同校准。
可以这样答:
微调数据先做格式、语言、模板和安全规则检查,再进行精确及语义去重;随后评估指令是否清晰、回答是否正确完整,并按任务、领域和难度重新采样。过滤不能只追高分,否则数据会越来越同质。LLM Judge 应与规则和人工抽检交叉使用,且保留来源与版本。验收要看重复率、人工通过率、能力覆盖,以及在独立真实任务上的增益和退化。
核心回答
先从目标能力和线上请求分布定义数据结构,再处理格式错误、乱码、重复与近重复、隐私和许可证风险、答案矛盾、低质量模板以及训练集与评估集污染。清洗后还要按任务、难度、领域、语言和安全类型做配比,避免体量最大的来源淹没关键小类。高质量少量数据在部分对齐场景中可以很有效,但不代表数据越少越好;覆盖范围、难例和分布匹配仍然重要。
展开说明
数据治理至少包含四层:
- 合法与安全:来源可用、敏感信息已处理、危险内容有明确用途与标签。
- 语法与格式:角色顺序、聊天模板、结束 token、结构化字段均可解析。
- 语义质量:问题可回答,答案正确、相关且不过度套话,拒答边界合理。
- 分布控制:统计来源、长度、语言、任务和难度,使用采样权重而非简单拼接。
去重不应只做字符串完全匹配。模板换词、网页镜像和同一答案轻微改写可能形成近重复,并造成验证集虚高。相反,过强去重也可能删除确有价值的不同推理路径,需要抽样检查误杀。
工程实践
为每条数据保留来源、处理步骤、质量标签和版本,建立可重放的数据流水线。训练前生成数据卡和分布报告,训练后按同一切片评估。新增数据先做小规模消融:比较加入前后的目标能力、通用能力和安全回归,确认收益来自内容而非数据量本身。
常见追问
- 近重复数据为什么会让验证指标虚高? 同一内容的改写或模板副本跨入训练和验证后,模型可凭记忆与表面模式得分,指标不再代表对独立样本的泛化。
- 多个数据源应该按原始数量混合还是重新采样? 通常按目标能力、质量和边际收益重采样;直接按数量会让最大但低质的数据源主导,过采小源又会增加重复过拟合。
- 如何发现高流畅度但事实错误的合成答案? 使用可验证工具或来源证据核对事实,加入独立 Judge 和人工抽检,并按教师、任务与错误类型追踪命中率而非只看流畅度。
一句话复习
微调数据工程不是把样本堆在一起,而是同时管理合法性、格式、语义质量、去重和能力分布。
参考资料
评论与补充
评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。
正在连接站内评论服务…
正在加载评论…
还没有评论,你可以先写下自己的理解或追问。