LLM INTERVIEW QUESTION BANK
大模型面试题,
一道一道讲明白。
覆盖模型原理、训练对齐、RAG、Agent、推理部署、评测安全、数学编程与项目行为面。每题包含答题提示、参考说法和常见追问。
232
道当前可见题目
47 道核心必会 · 185 道岗位专项 · 232 道已有解答
一个题库 · 两种可见性
+ 增加题目
全部题目
公开题所有人都能看到;标有“私人”的题只保存在当前浏览器。选择公开并保存后,题目会立即出现在这里。
私人题只在当前浏览器显示。
正在读取大家直接发布的公开题目…
共享题库暂时无法连接;仓库题和当前浏览器中的题目仍可正常使用。
001
Xavier 与 He 初始化分别基于什么方差推导,应该如何选择?
002
CBOW、Skip-gram 与 Negative Sampling 有什么区别?
003
网页预训练数据如何做质量过滤而不过度损失多样性?
004
VLM 如何用坐标 Token 实现短语定位与视觉 Grounding?
005
VLM 为什么会产生对象幻觉,POPE 如何评估?
006
vLLM 与 SGLang 的设计侧重点有什么不同,应该如何选择?
007
Vision Encoder 与 LLM 之间为什么通常需要 Projector?
008
梯度消失和爆炸为什么发生,如何诊断与缓解?
009
Transformer 为什么比 RNN 更适合训练大模型?
010
如何手算 Transformer 参数量与训练 FLOPs?
011
数据并行、张量并行和流水线并行如何组成 3D 并行?
012
大模型训练出现 Loss 为 NaN,应该如何排查?
013
MFU、HFU 与 Tokens/s 应如何衡量训练效率?
014
如何估算大模型训练显存,Gradient Checkpointing 省了什么?
015
GPU 集群如何做拓扑感知调度并减少资源碎片?
016
流式生成如何处理背压、断连和请求取消?
017
Teacher Forcing 是什么,为什么会产生 Exposure Bias?
018
SVD 如何得到最佳低秩近似,它与大模型低秩压缩有什么关系?
019
静态词向量和上下文表示有什么区别?
020
Softmax 与 LogSumExp 如何避免数值溢出?
021
语言模型的 Softmax Bottleneck 是什么?
022
滑动窗口注意力与全局注意力如何降低长序列复杂度?
023
SimPO 如何在没有 Reference Model 时做偏好优化?
024
SimCSE 如何用对比学习训练句向量?
025
SigLIP 与 CLIP 的损失函数有什么区别?
026
SFT 模型不收敛时应该如何定位问题?
027
Sequence Packing 如何用 Block-diagonal Mask 提速并避免样本污染?
028
句向量的 CLS、Mean Pooling 和加权池化如何选择?
029
Self-Instruct 如何生成、筛选并迭代合成指令数据?
030
RoPE 如何表示相对位置,为什么会遇到长上下文外推问题?
031
如何让大模型训练尽可能可复现?
032
高质量数据有限时,重复训练多少轮才合理?
033
安全模型如何平衡拒答与过度拒答,XSTest 评测什么?
034
Self-RAG 与 CRAG 如何让检索链路具备自反思和纠错能力?
035
RAPTOR 如何构建层次化 RAG,什么时候比平铺 Chunk 检索更合适?
036
RAG 中 Query Rewrite 与 HyDE 分别解决什么问题,如何选择?
037
项目复盘:RAG 上线后答案质量下降,应该如何定位?
038
向量检索中的 Metadata Filter 应该前置、后置还是迭代执行?
039
ColBERT 的 Late Interaction 为什么兼顾检索效果与效率?
040
GraphRAG 为什么要构建社区摘要,适合解决什么问题?
041
Embedding 模型升级时,如何重建索引、双写并无损切换?
042
RAG 文档入库时如何处理 PDF 版面、表格、页眉页脚与 OCR?
043
RAG 如何在 Token 预算内打包证据,证据顺序为什么重要?
044
Q-Former 如何用 Learnable Query 压缩视觉信息?
045
从输入 Prompt 到生成第一个 Token,模型内部经历了什么?
046
Prompt Compression 如何减少 Token 又尽量保留指令和证据?
047
过程监督与结果监督有什么区别?
048
DoReMi 如何自动优化预训练领域配比?
049
万亿 Token 预训练语料如何做精确与近似去重?
050
Prefix KV Cache 如何复用公共前缀并保证租户隔离?
051
Prefill 与 Decode 的计算和访存特征有什么不同?
052
Prefill/Decode 分离部署如何设计与扩缩容?
053
强化对齐中策略熵为什么会下降,如何识别与缓解模式坍缩?
054
GPipe、1F1B 与交错流水线如何影响 Bubble?
055
两个模型效果接近时,如何做成对评测与显著性检验?
056
PagedAttention 如何管理 KV Cache,它解决了什么问题?
057
ORPO 如何把 SFT 与偏好优化合并为一个阶段?
058
如何设计可恢复、可去重的大模型离线批量推理系统?
059
NCCL 集合通信超时或 Hang 应如何排查?
060
μP 为什么能把小模型超参数迁移到大模型?
061
恶意图片如何劫持 VLM 指令,视觉 Prompt Injection 怎样防御?
062
多模态大模型通常分哪些阶段训练?
063
Chameleon 式离散早融合如何把图像与文本统一成 Token 序列?
064
多语言 Embedding 如何对齐不同语言的语义空间?
065
多模型共享 GPU 时如何管理加载、驻留与淘汰?
066
S-LoRA 如何用分页 Adapter 内存高效服务数百个 LoRA?
067
多图与视频输入相比单图 VLM 增加了哪些困难?
068
MoE 中 Shared Expert 与 Routed Expert 有什么区别?
069
MoE 推理中的 Expert Parallel 如何工作,为什么容易被 All-to-All 和热点专家拖慢?
070
模型权重、Tokenizer 与 Adapter 的供应链风险如何治理?
071
最大似然估计 MLE 与最大后验估计 MAP 有什么区别?
072
为什么 max_model_len 越大,可用并发可能越低?
073
Matryoshka Embedding 如何支持可变向量维度?
074
LoRA 应该挂在哪些 Target Modules?
075
LoRA 的 Rank 和 Alpha 如何影响容量与更新尺度?
076
LoRA、QLoRA 与全参数微调应该如何选择?
077
LoRA 的低秩更新原理是什么,为什么一个矩阵常零初始化?
078
为什么标称上下文长度不等于有效上下文长度,RULER 如何评测?
079
大模型为什么会记忆并泄露训练数据,如何评估提取风险?
080
Tokenizer 为什么会成为大模型服务的 CPU 瓶颈,如何优化?
081
如何为 LLM 服务定义 SLO、错误预算与过载策略?
082
大模型服务为什么会冷启动,怎样设计加载、预热与就绪检查?
083
如何设计可信的 LLM Serving 压测并计算 Goodput?
084
如何按风险等级设计大模型发布门禁?
085
线上缺少即时标签时如何监控模型质量漂移?
086
生产大模型应用如何防止 PII 泄露?
087
大模型上线如何设计 A/B 测试并避免护栏指标退化?
088
项目复盘:模型升级后 P99 延迟翻倍,应该如何排查?
089
LLM-as-a-Judge 有哪些位置、长度和自增强偏差,如何校准?
090
如何系统评估越狱攻击,并建立分层防御而不是只靠系统提示词?
091
大模型线上事故如何止损、定位、复盘与演练?
092
如何评测大模型的群体偏见与公平性?
093
如何设计一个可复现的大模型评测平台?
094
如何设计能代表真实流量的 LLM 离线评测集?
095
项目案例题:如何讲清一次质量不降、成本下降的优化?
096
如何评估大模型置信度、校准误差与选择性回答能力?
097
大模型 API 网关如何按 Token 做限流、配额、预留与用量结算?
098
为什么大模型训练常用 Warmup,常见学习率调度如何选择?
099
Label Smoothing 如何修改训练目标,为什么可能改善泛化却损害校准或蒸馏?
100
KV Cache 量化与 CPU/NVMe Offload 应如何取舍?
101
KTO 如何用非成对的好坏反馈做偏好对齐?
102
知识蒸馏如何用 Teacher 训练 Student,温度参数有什么作用?
103
Forward KL 与 Reverse KL 有什么区别,为什么会分别表现为覆盖模式与寻找模式?
104
Jacobian、Hessian 分别描述什么,为什么大模型训练很少显式构造 Hessian?
105
In-Context Learning 与参数微调有什么本质区别?
106
类别不平衡时 Precision、Recall、F1、ROC-AUC 与 PR-AUC 怎么选?
107
一张图片如何转换成视觉 Token?
108
Chatbot Arena 如何用成对偏好、Elo 或 Bradley–Terry 排名模型?
109
GRPO 中 πθ、πold 与 Rollout 策略分别是什么,如何同步?
110
Gradient Noise Scale 与 Critical Batch Size 是什么?
111
梯度裁剪为什么常按 Global Norm 做,应该在训练流程的哪个位置执行?
112
梯度累积如何影响有效 Batch、学习率与分布式同步?
113
为什么 GPU 还有空闲显存却 OOM,如何分析分配器碎片与内存池?
114
PPO 中 GAE 如何估计 Advantage 并权衡偏差与方差?
115
FP8 推理与 INT8、INT4 推理有什么区别?
116
类别不平衡除了换指标,还可以怎样训练,Focal Loss 有什么作用?
117
Few-shot 示例的选择与顺序为什么会影响结果?
118
训练中维护参数 EMA 有什么作用,它与 Polyak Averaging 有何区别?
119
Embedding 检索中余弦、点积和欧氏距离如何选择?
120
输入 Embedding 与 LM Head 为什么常共享权重?
121
训练 Embedding 时如何选择 Hard Negative 而不引入假负例?
122
Embedding 的各向异性与 Hubness 是什么,如何诊断?
123
弹性分布式训练如何在 Worker 故障或扩缩容后恢复并保持状态一致?
124
Early Stopping 如何使用,为什么反复看验证集也会过拟合?
125
Dynamic Resolution 与 AnyRes 为什么对 VLM 很重要?
126
Dropout 为什么能正则化,训练和推理时有何不同?
127
领域继续预训练与 SFT 应该如何选择和衔接?
128
文档 VLM 中 OCR-first 与 OCR-free 路线如何选择?
129
分布式训练的数据加载、分片与断点续训如何设计?
130
分布式训练如何保存、重分片并精确恢复 Checkpoint?
131
DeepNorm 如何让超深 Transformer 稳定训练?
132
训练、验证、测试集如何划分,哪些做法会造成数据泄漏?
133
CUDA Graph、模型编译与 Kernel Fusion 分别优化什么?
134
交叉验证与超参数搜索如何避免选择偏差和数据泄漏?
135
交叉熵、负对数似然与 Perplexity 有什么关系?
136
Continuous Batching 如何在逐迭代调度中平衡 Token 预算、抢占与公平性?
137
Constitutional AI 与 RLAIF 如何减少人工偏好标注?
138
代码模型的 pass@k 应该如何计算,为什么不能只看 pass@1?
139
CLIP 如何用对比学习对齐图像与文本?
140
Chunked Prefill 如何兼顾 TTFT 与 TPOT?
141
Chain-of-Thought 与 Self-Consistency 为什么能改善复杂推理?
142
多副本推理如何在 Prefix Cache 命中与负载均衡间取舍?
143
偏差与方差如何解释欠拟合和过拟合?
144
预训练数据如何做 Benchmark Decontamination?
145
Beam Search 为什么会有长度偏置,Length Penalty 如何处理?
146
BatchNorm 与 LayerNorm 的归一化维度有何不同,为什么 Transformer 更常用 LayerNorm?
147
反向传播和自动微分有什么区别,计算图如何得到梯度?
148
自回归语言模型的训练目标与 Label Shift 是什么?
149
语音大模型如何把音频变成 Token,并同时支持理解与生成?
150
多头注意力的 Head 是否都必要,如何分析与剪枝?
151
ALiBi 如何用线性偏置表示位置并外推长度?
152
怎样为 Agent 设计易调用、可校验且安全的工具接口?
153
允许 Agent 执行代码时,如何设计 Sandbox、网络和资源隔离?
154
Reflexion 如何让 Agent 从失败轨迹中学习而不更新模型参数?
155
MCP 的 Host、Client、Server 如何协作,安全边界在哪里?
156
Agent 如何设计 Human-in-the-Loop 审批、中断与可恢复执行?
157
Computer-Use Agent 如何完成屏幕感知、动作落点与闭环纠错?
158
A2A 协议如何支持 Agent 发现、任务生命周期与跨系统协作?
159
AdamW 为什么要把 Weight Decay 与梯度更新解耦?
160
Activation Checkpointing 如何用重计算换显存,切分点应该怎样选择?
161
ZeRO-2、ZeRO-3 与 FSDP 如何切分训练显存?
162
大模型微调数据应该如何清洗、去重和配比?
163
BPE、WordPiece、Unigram 和 SentencePiece 有什么区别?
164
如何让大模型稳定输出结构化数据,并安全地驱动业务动作?
165
推测解码为什么能加速生成,什么时候反而收益不大?
166
SFT 为什么常只计算回答部分的损失?
167
Scaling Laws 与计算最优训练说明了什么?
168
temperature、top_p 和 max_tokens 分别有什么作用?
169
经典 RLHF 路线与标准离线 DPO 有什么区别?
170
奖励模型如何用成对偏好数据训练?
171
如何识别并缓解奖励黑客和能力退化?
172
RAG 与微调应该如何选择?
173
向量检索中如何选择 Flat、HNSW、IVF 和 PQ?
174
稀疏检索和稠密向量检索有什么区别?
175
如何用 Recall@K、MRR 和 nDCG 评估 RAG 检索?
176
RAG 如何处理需要多跳证据的问题?
177
如何让 RAG 支持增量更新、权限过滤和引用溯源?
178
RAG 中如何组合 BM25 与向量检索?
179
为什么用了 RAG 仍会产生幻觉,如何治理?
180
为什么 RAG 常用 Cross-Encoder 做重排?
181
RAG 中如何选择 Chunk 大小和重叠长度?
182
一个完整的 RAG 流水线包含哪些步骤?
183
预训练、SFT 和偏好对齐分别解决什么问题?
184
偏好数据中的 chosen / rejected 样本应该如何构造?
185
Pre-Norm 与 Post-Norm 有什么区别?
186
LLM 的 PPO 对齐流程中,Clip、KL 和四个模型分别做什么?
187
Transformer 为什么通常需要显式位置信息?
188
如何设计多租户大模型平台的权限、成本与可观测性?
189
如何为大模型平台设计跨地域容灾与降级?
190
MoE 如何路由 token,并解决专家负载不均?
191
大模型训练中 FP16、BF16 和 FP32 应该如何配合?
192
MHA、MQA 和 GQA 的区别是什么?
193
微调模型上线时,LoRA 适配器应动态加载还是合并权重?
194
如何对大模型在线服务做容量估算?
195
大模型语义缓存应该怎样设计,如何避免错误命中和数据越权?
196
大模型量化中的 INT8、INT4、PTQ 和 QAT 应该如何理解与选择?
197
线上大模型应用应该观测哪些指标,怎样做到可排障又不泄露数据?
198
如何设计多模型路由、升级与故障降级?
199
如何定位大模型推理中的显存、算力与内存带宽瓶颈?
200
如何设计大模型反馈数据闭环,并避免隐私、偏差和评测泄漏?
201
如何构建可复现的大模型应用评估与回归测试?
202
如何估算大模型功能的成本,并在不明显降质的前提下降本?
203
多轮大模型应用的会话状态应该如何存储与裁剪?
204
模型或 Prompt 变更如何做灰度评测、发布与快速回滚?
205
模型、Prompt、数据和索引如何统一版本化并支持回滚?
206
Encoder-Only、Decoder-Only 和 Encoder-Decoder 架构如何选择?
207
一个线上大模型应用通常包含哪些核心模块?
208
LayerNorm 与 RMSNorm 有什么区别?
209
KV Cache 为什么能加速推理,又带来什么代价?
210
如何为高并发 LLM 服务设计批处理、排队和限流?
211
GRPO 的核心思想是什么,与 PPO、DPO 如何比较?
212
GPU 大模型服务应该根据什么信号自动扩缩容?
213
FlashAttention 为什么更快,它改变了注意力复杂度吗?
214
Transformer 中的 FFN 有什么作用,SwiGLU 为什么常见?
215
大模型多 GPU 推理中,张量、流水线和数据并行应该如何组合?
216
领域微调时如何识别并缓解灾难性遗忘?
217
Causal Mask、Padding Mask 和样本边界 Mask 分别解决什么问题?
218
如何设计可取消、可恢复的异步大模型长任务系统?
219
LLM Agent 与固定 Workflow 有什么区别?
220
Agent 的工具调用失败后应该如何恢复?
221
LLM 的 Tool Calling 是怎样工作的?
222
ReAct 如何把推理与工具行动结合起来?
223
如何防御 Agent 的间接 Prompt Injection 和工具滥用?
224
Agent 常见的规划策略有哪些,如何选择?
225
什么时候应该使用多 Agent,如何设计协作机制?
226
Agent 的短期记忆与长期记忆应该如何设计?
227
如何系统评估一个有工具调用的 Agent?
228
一个 LLM Agent 通常由哪些核心组件组成?
229
长任务中的 Agent 上下文应该如何管理?
230
怎样提高 LLM Agent 的可靠性?
231
如何系统地提升 RAG 的召回质量?
232
Self-Attention 为什么要除以 √dₖ?
没有找到匹配的题目,换个关键词试试。