← 返回题库
第 007 题 · 多模态 · 简单

Vision Encoder 与 LLM 之间为什么通常需要 Projector?

岗位专项 这代表什么?
✓ 资料核验 来源说明:用户提供的分级面试题单;公司归属未独立核验,技术答案依据原论文整理
ProjectorVision EncoderVLM
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

先纠正“只是改维度”的说法:视觉编码器和 LLM 即使维度相同,表示空间也未必对齐,Projector 还承担语义映射。接着比较 Linear、MLP 与带压缩能力的 Resampler 或 Learnable Query。

面试官常问它是否会减少视觉 Token。普通逐 Token Projector 不会,只有额外池化或重采样结构才会;这也是 Linear、MLP 与 Q-Former、Resampler 最容易混淆的边界。

可以这样答:

Vision Encoder 输出的特征维度和语义空间通常都与 LLM 不一致,因此需要 Projector 把视觉表示映射成语言模型可消费的视觉 Token。线性层只做轻量映射,MLP 能学习更强的非线性对齐;如果还要缩短视觉序列,则需加入池化、Q-Former 或 Resampler。普通逐 Token Projector 只改变表示,不会自动减少视觉 Token 数,这是它与视觉压缩模块的边界。

核心回答

视觉编码器输出与 LLM 输入通常存在两个接口差异:向量维度可能不同,表示空间也不是按同一训练目标形成的。Projector 把视觉特征映射到 LLM 可接收的 Embedding 维度,并通过图文训练让映射后的向量具备语言模型可利用的语义。它不是简单“改 Shape”,而是视觉与语言之间的可学习适配层。

最简单的线性 Projector 可写为 \(Z = X_vW+b\),其中 \(X_v \in \mathbb{R}^{N \times d_v}\),\(W \in \mathbb{R}^{d_v \times d_l}\),输出 \(Z \in \mathbb{R}^{N \times d_l}\)。MLP Projector 增加非线性;Resampler 或 Q-Former 还能在映射维度的同时改变 Token 数。采用哪种接口随模型架构、数据规模和延迟预算而异,并不是越复杂越好。

展开说明

“Vision Encoder 与 LLM 不能直接连接”不是数学上的绝对结论:若维度和接口碰巧一致,张量可以直接输入,但没有对齐训练时,LLM 通常无法正确解释这些视觉向量。常见连接方案包括:

  • 线性层:参数少、易训练,LLaVA 的早期设计证明简单映射也能有效工作。
  • 两层 MLP:增加表达能力,但会带来更多参数和过拟合可能。
  • Cross-Attention / Resampler:用少量查询读取大量视觉特征,可以压缩 Token,但训练和推理更复杂。
  • Q-Former:以固定数量可学习 Query 从冻结视觉编码器中提取信息,再连接 LLM。

视觉 Token 插入 LLM 的方式也不唯一:可以作为文本前缀、放在特殊图像边界 Token 之间,或者通过语言层中的 Cross-Attention 注入。回答时应先说明具体模型采用哪一种。

工程实践

训练第一阶段常先冻结视觉编码器和 LLM,仅训练 Projector,降低对齐成本;后续是否解冻 LLM 或视觉编码器要看数据量和任务。调试时检查 Projector 输入层、特征层选择、Token 顺序、dtype、位置与特殊 Token 是否一致,并分别监控视觉编码器、Projector 和 LLM 的梯度范数。评估要覆盖纯文本能力,防止多模态微调破坏原有语言能力。

常见追问

  1. 维度相同后是否可以不要 Projector? 张量可以相接,但维度相同不代表语义空间已对齐;通常仍需联合训练或其他适配机制。
  2. Linear Projector 与 MLP 如何选择? 线性层更轻、更容易归因;MLP 容量更大,适合映射关系更复杂且数据充足的情况,最终应做同预算消融。
  3. Projector 能否压缩视觉 Token 数? 普通逐 Token 线性层不能;带 Pooling、Learnable Query 或 Cross-Attention 的 Resampler 才能改变序列长度。
  4. Projector 训练好后一定要解冻 Vision Encoder 吗? 不一定;冻结可保留视觉表征并节省显存,只有在领域差异明显且数据足够时才更值得尝试解冻。

一句话复习

Projector 负责把视觉特征映射并对齐到 LLM 能消费的表示空间;线性、MLP 与查询式压缩只是不同成本和容量的实现。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…