← 返回题库
第 060 题 · LLM 基础 · 困难

μP 为什么能把小模型超参数迁移到大模型?

岗位专项 这代表什么?
✓ 资料核验 来源说明:公开面经题库主题;公司归属未独立核验,技术答案依据原论文或官方文档整理
μP超参数迁移参数化
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

μP 要回答的是“小模型超参数为何能沿宽度迁移”,不是小模型能否预测大模型能力。说明输入、隐藏、输出参数需要不同初始化、学习率和输出缩放,才能让宽度变化时激活与更新尺度可比;它主要保证宽度方向,换深度、优化器或架构仍需重新验证。

可以这样答:

μP 通过针对不同参数类型设计初始化、学习率和输出缩放,让模型变宽时激活与参数更新仍处在可比尺度,因此小模型搜索出的学习率等超参数更容易迁移。它解决的主要是宽度方向的参数化问题,并不保证换深度、优化器、数据配比或架构后仍可直接复用。

核心回答

μP(Maximal Update Parametrization)不是一种新优化器,而是一套随网络宽度缩放初始化、学习率和输出乘子的参数化规则。它希望宽度 \(n\) 增大时,每层激活保持 \(\mathcal{O}(1)\),训练产生的特征变化也保持非退化的 \(\mathcal{O}(1)\):既不会趋近于零而只剩核方法行为,也不会随宽度爆炸。

在同一 μP 模型族中,可以先用较窄的 Proxy Model 搜索学习率、初始化尺度等,再把最优值迁移到更宽的 Target Model,这称为 μTransfer。具体缩放指数依赖参数类型、矩阵朝向和优化器,不能用一条“所有层学习率都除以宽度”的规则概括。

展开说明

标准参数化通常保证前向激活在初始化时稳定,却不保证不同宽度下参数更新对特征的影响相同。因此模型加宽后,原学习率的有效尺度会变化,需要重新搜索。μP 按输入层、隐藏矩阵、偏置和读出层区分规则,使 \(h_l = \mathcal{O}(1)\) 且一次训练更新造成的 \(\Delta h_l = \mathcal{O}(1)\),由此让超参数最优点在宽度方向更稳定。

可迁移并不等于所有超参数无条件通用。论文主要讨论在架构对应、参数化正确时跨宽度迁移的学习率、初始化和各种 multiplier;深度、Batch Size、数据分布、优化器或架构模块同时变化,会引入新的尺度,往往仍需验证。实现若漏标一个参数类型,也可能让整体不再满足 μP。

工程实践

先建立可自动检查的 Base Shape,确认每个参数相对 Proxy 的无限宽维度,再使用与优化器匹配的 μP 初始化和学习率规则。至少选择三个宽度做学习率扫描,观察最优区间是否对齐,然后才外推到昂贵的大模型。记录激活 RMS、更新/权重比和损失曲线,可较早发现读出层或新模块未正确参数化。

常见追问

  1. μP 与 Scaling Laws 有什么不同? Scaling Laws 描述损失随参数、数据和计算的经验变化;μP 试图让训练超参数跨宽度保持可迁移,解决的是参数化与调参成本。
  2. μP 能让小模型的最终能力预测大模型吗? 不能直接保证。它主要迁移最优超参数位置,不意味着小模型的绝对损失或涌现能力与大模型相同。
  3. 为什么不能给出一张适用于所有模型的学习率缩放表? 缩放取决于张量属于输入、隐藏还是读出参数,也依赖 SGD、Adam 等优化器及实现的矩阵维度约定。

一句话复习

μP 让激活与特征更新在加宽时保持非退化尺度,因此可在同构小模型上调参,再把结果迁移到更宽模型。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…