← 返回题库
第 116 题 · NLP 与机器学习 · 中等

类别不平衡除了换指标,还可以怎样训练,Focal Loss 有什么作用?

岗位专项 这代表什么?
✓ 资料核验 来源说明:公开面经题库主题;公司归属未独立核验,技术答案依据原论文或官方文档整理
Focal Loss类别不平衡重采样
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

把公式 \(-\alpha_t(1-p_t)^\gamma\log p_t\) 写出来,再解释调制因子:易样本的 \(p_t\) 接近 1,权重被压低;难样本保留更大梯度,\(\gamma=0\) 时退化为加权交叉熵。追问缺点时要说错标样本也会被当作难例放大,因此不能用 Focal Loss 掩盖标签质量问题。

可以这样答:

Focal Loss 写作 \(-\alpha_t(1-p_t)^\gamma\log p_t\)。当样本已经被正确且高置信预测时,\(p_t\) 接近 1,调制因子会显著降低它对梯度的贡献;难分类样本则保留更大权重。\(\gamma=0\) 时它退化为带类别权重的交叉熵。它适合大量易负例的场景,但也会放大错标和异常样本,因此要配合标签抽检与校准评估。

核心回答

可从数据、损失和决策三层处理:对少数类重采样或增强,给类别加权,使用 Focal Loss 等难例聚焦损失,最后按业务成本调阈值。二分类 Focal Loss 常写成 \(-\alpha_t(1-p_t)^\gamma\log p_t\);预测越容易,\(p_t\) 越大,其损失权重越小,从而让训练更关注难分样本。它最初用于密集目标检测中前景与海量简单背景的不平衡,并不是所有不平衡任务的默认最优解。

展开说明

\(\gamma=0\) 时退化为带 \(\alpha\) 权重的交叉熵;增大 \(\gamma\) 会更强地压低简单样本贡献。类别加权主要修正类别频率,Focal 的调制项主要区分难易。标签噪声也常表现为高损失“难例”,过度聚焦可能放大噪声;重采样则会改变有效训练分布和梯度方差。

工程实践

先建立交叉熵加阈值调整的基线,再分别消融加权、采样和 Focal。所有方法都在原始业务分布验证,并检查概率校准、少数类子群体和误报绝对量。若使用过采样,按实体而非单条样本切分,避免同源增强样本泄漏到验证集。

常见追问

  1. \(\alpha\) 和 \(\gamma\) 分别控制什么? \(\alpha\) 平衡类别贡献,\(\gamma\) 按样本难易抑制已正确分类的简单样本。
  2. Focal Loss 为什么可能伤害概率校准? 它改变了对数似然的优化权重,输出分数不再天然对应原始分布下的概率,需要单独校准。
  3. 重采样与类别加权是否等价? 在理想期望上可能相近,但小批量组成、梯度方差、数据增强和优化动态并不等价。

一句话复习

Focal Loss 用 \((1-p_t)^\gamma\) 降低简单样本权重;先确认难例不是噪声,再与重采样、类别权重和阈值联合比较。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…