多模态大模型通常分哪些阶段训练?
先用自己的话答,再看参考说法
60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。
别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。
参考内容当前已显示;开始口述后会暂时隐藏。
面试时怎么答
多模态训练通常按视觉—语言对齐、联合预训练、指令微调、偏好与安全对齐展开。回答时说清每阶段的数据、目标以及哪些模块冻结或解冻;过早全量解冻可能破坏文本能力,始终冻结视觉端又限制领域适配,阶段之间应保留单模态回归检查。
可以这样答:
多模态模型通常先做视觉—语言对齐,让视觉特征进入语言空间;再做大规模图文联合预训练;之后用多模态指令数据学习交互;最后进行偏好与安全对齐。早期常冻结大部分模块只训练连接器,后续再逐步解冻。过早全量解冻可能损害文本能力,长期冻结又会限制视觉领域适配。
核心回答
一种常见训练路线是:先得到可用的视觉编码器和语言模型,再做视觉—语言特征对齐,然后进行多模态指令微调,最后按需要加入偏好、安全或领域专项对齐。各阶段解决的问题不同:对齐阶段让视觉表示进入 LLM 的表示空间;指令微调让模型学会根据图像和指令完成多种任务;后续对齐改善回答偏好、安全边界或特定业务能力。
这不是所有 VLM 都必须遵循的固定四阶段模板。LLaVA 的经典方案先冻结视觉编码器和 LLM、训练连接投影,再保持视觉编码器冻结并联合更新 Projector 与 LLM 做视觉指令微调;BLIP-2 则使用 Q-Former 在冻结图像编码器和冻结 LLM 之间分阶段学习。是否解冻、何时解冻以及训练哪些损失都随架构和数据而异。
展开说明
可以从以下阶段组织回答:
- 单模态预训练:视觉编码器学习图像表征,LLM 学习语言与推理能力;多数项目直接复用已有模型。
- 视觉—语言对齐:使用图文对、Caption 等数据训练 Projector、Q-Former 或部分模型,使视觉特征成为 LLM 可消费的输入。
- 多模态指令微调:用视觉问答、对话、OCR、图表和推理数据训练指令遵循,常对 Assistant 回答 Token 计算生成损失。
- 可选后训练:使用偏好数据、拒答与安全数据、可验证奖励或领域数据继续对齐,并通过回归评测约束纯文本和视觉能力退化。
第一阶段常冻结两侧大模型,是为了降低显存和灾难性遗忘风险,让桥接层先学会基本接口;当图像领域与原视觉编码器差异很大,或细粒度定位需求很强时,才更有理由解冻部分视觉层。解冻范围越大,越需要更低学习率、更丰富数据和更严格回归。
工程实践
每个阶段要版本化视觉预处理、Tokenizer、Chat Template、特殊图像 Token、冻结策略和 Loss Mask。训练日志分别记录图文对齐指标、生成 Loss、纯文本回归和视觉任务切片;不能用下一阶段训练集同时充当最终评测。混合多任务数据时按有效 Token 或样本类型监控配比,避免简单 Caption 淹没 OCR、图表和多图推理。阶段切换前保存可独立回滚的检查点,并验证 Projector 与基座版本兼容。
常见追问
- 为什么对齐阶段常冻结 Vision Encoder 和 LLM? 这样只需训练较小桥接模块,成本低且能减少对已有视觉、语言能力的扰动。
- 什么时候应解冻视觉编码器? 当目标图像域差异大、原编码器缺少关键细节,且有足够高质量数据与算力时,可尝试解冻后几层或全模型。
- 对齐数据与指令数据有什么差别? 对齐数据主要建立图像特征与语言空间的接口,指令数据还要求模型理解任务意图并生成符合要求的回答。
- 多模态微调为什么要测纯文本回归? 更新 LLM 可能损害原有语言、代码或安全能力,视觉任务提升不能证明这些能力仍被保留。
一句话复习
多模态训练通常先接通视觉与语言表示,再学习视觉指令遵循,最后按需做偏好、安全或领域对齐;冻结与解冻策略取决于架构和数据。
参考资料
评论与补充
评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。
正在连接站内评论服务…
正在加载评论…
还没有评论,你可以先写下自己的理解或追问。