← 返回题库
第 067 题 · 多模态 · 困难

多图与视频输入相比单图 VLM 增加了哪些困难?

岗位专项 这代表什么?
✓ 资料核验 来源说明:用户提供的分级面试题单;公司归属未独立核验,技术答案依据原论文整理
Multi-ImageVideo VLMTemporal Modeling
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

多图与视频相对单图新增四类问题:跨帧实体对应、事件时序、视觉 Token 爆炸和帧/图边界混淆。回答沿采帧、视觉编码、时间位置标识、Token 压缩和跨模态交互讲清数据流,再说明密集采帧与强压缩分别可能付出的延迟和漏事件代价。

可以这样答:

多图和视频不是把图片简单拼起来,它还要解决跨帧实体对应、事件时序、视觉 Token 爆炸以及帧边界混淆。常见流程是按镜头或任务采帧,加入帧号与时间信息,再压缩视觉 Token 与文本交互。密集采帧能保住短动作却更慢,压缩过强又可能漏掉小目标和短事件。

核心回答

单图主要需要建模二维空间内容;多图还要区分图片边界、顺序和跨图对应关系,视频则进一步需要保留时间顺序、运动和事件持续性。模型必须知道“第几张图或第几帧”的视觉 Token,能把文本中的“前一张”“后来”等指代映射到正确片段,并在有限 Token 预算内选择有用证据。

多图常为每张图添加边界标记、图像编号或分段位置,再按 Prompt 顺序拼接或分层聚合视觉 Token;这种排列顺序是否代表真实时间顺序,取决于任务和训练协议。视频可以均匀采帧、关键帧采样或学习式选择,再加入时间位置、时空注意力或统一图像—视频表示。具体模型可能使用 2D/3D 位置编码、Cross-Attention、Token Pooling 或视觉 Resampler,不能假设所有 VLM 都把帧简单首尾拼接。

展开说明

新增困难主要有四类:

  1. 身份与顺序:需要区分不同图片和帧,防止跨图对象、OCR 文本或事件被混淆。
  2. 时空关系:视频问题常依赖动作先后、状态变化和短暂事件,单帧语义不能完整表达。
  3. 采样偏差:均匀采帧覆盖全局但可能漏掉短事件;关键帧节省 Token,却依赖选择器且可能丢失连续运动。
  4. Token 爆炸:图片数、帧数、分辨率和每帧 Patch 数相乘,快速推高视觉编码、Prefill 与显存成本。

大量视觉 Token 对 KV Cache 的影响取决于架构。若视觉向量作为 Decoder-Only LLM 的前缀 Token,它们通常参与 Prefill 并形成各层 K/V;若先被固定数量 Query 压缩或通过独立 Cross-Attention 读取,占用模式会不同。回答容量问题时必须先声明模型接口。

工程实践

建立“图片数/视频时长 × 采样帧数 × 分辨率”的压测矩阵,记录任务质量、TTFT、显存和吞吐。评测要包含图序打乱、跨图对比、短暂事件、长视频定位和相似帧干扰,避免模型仅靠单帧捷径作答。线上应设置最大帧数和视觉 Token 预算,并让采样器、视觉预处理与模型版本一起发布;对安全敏感场景还要检查被跳过帧是否包含关键证据。

常见追问

  1. 如何表示不同图片的顺序? 可用图片边界 Token、图像编号、分段位置或二维/多维位置表示,具体取决于模型训练时采用的接口。
  2. 均匀采帧和关键帧采样如何取舍? 均匀采样简单且覆盖全局,但会漏短事件;关键帧更省预算,却可能因选择错误丢失证据。
  3. 视频为什么不能只当作很多独立图片? 独立图片缺少显式时间关系,难以表达运动方向、事件先后和跨帧对象持续性。
  4. 视觉 Token 增多会怎样影响 Prefill 与 KV Cache? Decoder 前缀式架构会增加 Prefill,并通常扩大各层缓存;查询压缩或独立 Cross-Attention 架构的增长方式不同。

一句话复习

多图与视频 VLM 除了识别画面,还要管理图像身份、时间关系、采样误差和成倍增长的视觉 Token 预算。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…