← 返回题库
第 187 题 · LLM 基础 · 简单

Transformer 为什么通常需要显式位置信息?

核心必会 这代表什么?
✓ 资料核验 来源说明:公开面经高频主题;答案依据论文和官方文档原创整理
Transformer位置编码
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

位置编码先用交换词序的例子说明:没有位置信息,自注意力对输入排列等变,无法稳定区分“人咬狗”和“狗咬人”。随后比较绝对位置、相对偏置与 RoPE 怎样把索引或相对位移注入注意力,并强调相对方案也不等于可以无限长度外推。

可以这样答:

没有位置编码时,自注意力只根据 Token 内容计算关系,对输入排列等变,难以区分“人咬狗”和“狗咬人”。绝对位置为每个索引加入表示,相对偏置直接建模距离,RoPE 通过旋转让注意力内积包含相对位移。相对方法通常更适合长度变化,但也不代表可以无限外推。

核心回答

不含位置输入和 Mask 的全注意力算子具有置换等变性:它只根据 token 内容之间的关系计算权重,没有显式的“第几个位置”概念。位置编码或其他位置机制把顺序、距离等信息注入表示,使模型能区分词相同但顺序不同的序列。

展开说明

常见代表方案包括:

  1. 绝对位置编码:为每个位置提供向量,例如固定的正弦、余弦编码或可学习的位置向量。
  2. 相对位置编码:直接表达两个 token 之间的相对距离,更贴近注意力中的两两关系。
  3. 旋转位置编码(RoPE):按位置旋转 Query 和 Key,使注意力内积带上相对位移信息;它与相对位置思想存在重叠,并不是完全互斥的第三类。

因果 Mask 的首要作用是限制可见性,它也会泄露部分顺序和位置信号;NoPE 因果模型甚至可以从这种结构中学到隐式位置信息。但这不等同于显式位置编码,传统 Transformer 通常仍会加入专门的位置机制。不同方案在训练长度、外推能力、计算成本和模型兼容性上各有取舍。

工程实践

扩展上下文长度时不能只把配置中的最大长度改大。需要检查位置编码方案是否支持外推,并用长文档检索、多跳问答和原长度任务一起回归,避免长上下文提升后短文本能力下降。

常见追问

  1. 正弦位置编码与可学习位置编码有什么区别? 正弦编码由固定频率函数生成、无需训练参数;可学习编码从数据优化,但超出已训练索引时通常没有自然定义。
  2. RoPE 为什么能表示相对位置? 它按位置旋转 Query 和 Key,二者内积中的旋转角差只依赖相对位移,从而把距离关系带入注意力分数。
  3. 只有因果 Mask、没有位置编码会怎样? Mask 能区分可见前缀范围,但模型对可见 Token 内部的精确顺序表达仍受限,难以稳定学习位置敏感关系。

一句话复习

Attention 负责找相关内容,位置编码负责告诉模型这些内容按什么顺序出现。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…