← 返回题库
第 124 题 · NLP 与机器学习 · 中等

Early Stopping 如何使用,为什么反复看验证集也会过拟合?

岗位专项 这代表什么?
✓ 资料核验 来源说明:公开面经题库主题;公司归属未独立核验,技术答案依据原论文或官方文档整理
Early Stopping模型选择验证集
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

回答要包含可执行规则:预先确定验证指标、方向、min_delta 和 patience,只在真正改善时保存最佳权重,触发停止后恢复最佳点。然后指出反复根据同一验证集改配置也会过拟合。面试官若问测试集何时用,回答最终方案锁定后只评一次。

可以这样答:

Early Stopping 先选定验证指标及优化方向,并设置最小改善量 min_delta 和容忍次数 patience。每次验证只有超过改善阈值才更新最佳 Checkpoint,连续多次没有改善就停止,并恢复最佳权重。它能减少后期过拟合和无效计算,但如果反复看验证结果改超参数,仍会过拟合验证集;独立测试集应在方案锁定后使用。

核心回答

Early Stopping 定期评估验证指标,在连续若干次没有足够改善后停止,并恢复历史最佳检查点。它既节省计算,也可限制模型继续贴合训练噪声。关键参数包括监控指标、评估频率、最小改善量和 patience。若团队根据同一验证集反复改模型、提示词和数据,决策过程会逐渐适应该集合,验证分数也会产生选择偏差。

展开说明

验证指标有随机波动,patience 太小可能在暂时平台期提前停止,太大则失去正则和节省作用。应保存“最佳”而非“最后”检查点,并明确指标方向。多次搜索中选出的最高分含有赢家诅咒;增加搜索次数而不增加独立证据,最佳验证分数通常越来越乐观。

工程实践

根据指标噪声确定评估间隔和 patience,记录每次实验的完整学习曲线。先用开发集迭代,再用冻结的保留集做里程碑评测;重要结论运行多个随机种子并报告置信区间。LLM 任务还应监控能力、安全和格式等多个约束,避免只优化单一平均分。

常见追问

  1. Early Stopping 应监控训练损失还是验证指标? 通常监控最贴近上线目标的验证指标;训练损失只能说明拟合过程。
  2. 停止后为什么要恢复最佳检查点? 触发 patience 时最后一次参数通常已越过历史最佳验证点。
  3. 怎样减少对验证集过拟合? 限制试验自由度、保留独立测试集、使用嵌套评测或多份时间切片,并对最终候选做少量复核。

一句话复习

Early Stopping 用验证曲线决定何时停并恢复最佳点;同一验证集被反复用于决策,也会被团队层面的搜索过拟合。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…