← 返回题库
第 034 题 · RAG · 困难

Self-RAG 与 CRAG 如何让检索链路具备自反思和纠错能力?

岗位专项 这代表什么?
✓ 资料核验 来源说明:公开面经题库主题;公司归属未独立核验,技术答案依据原论文或官方文档整理
Self-RAGCRAG自反思
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

先分别说机制,避免把两个名词混成“都会反思”。Self-RAG 通过训练让模型产生是否检索、证据是否相关、回答是否受支持等控制信号;CRAG 通常增加一个检索质量评估器,再按置信度触发纠错或补充检索。

追问价值时要提成本:判断和二次检索会增加延迟,也可能误判。简单事实问题不必每次都走完整反思链路,应该设置路由和预算。

可以这样答:

Self-RAG 把“是否需要检索、证据是否相关、回答是否被支持”等判断融入模型生成过程,通过控制 Token 决定检索和自检。CRAG 更像在现有 RAG 外增加检索评估器,质量不足时重写查询、补充来源或纠正上下文。两者都想避免盲目使用低质量证据,但会增加调用与延迟,评估器也会出错,因此应按问题难度触发,并衡量纠错收益、误触发率和成本。

核心回答

传统 RAG 常常固定召回 \(k\) 个片段后直接生成;Self-RAG 和 CRAG 都把“是否需要检索、检索是否可靠、回答是否被证据支持”纳入控制环,但机制不同。

Self-RAG 训练语言模型生成特殊的反思 Token:按需决定是否检索,并对片段相关性、生成内容的证据支持程度和回答效用进行批判,从而在解码时控制和筛选候选。CRAG 则在外部增加轻量检索评估器,根据检索质量置信度触发不同动作;低质量时可以扩展到 Web 搜索,同时对文档执行分解、筛选和重组。前者核心是经过训练的自反思生成模型,后者更像可插拔的检索纠错层,二者不能只凭名字视为同一算法。

展开说明

Self-RAG 的关键流程是:

  1. 模型通过检索决策 Token 判断当前生成步骤是否需要外部知识。
  2. 需要时检索片段,再评价片段对问题是否相关。
  3. 生成内容后评价它是否得到证据支持,并给出整体效用信号。
  4. 推理时可用这些反思 Token 的概率对不同候选进行打分和控制,在事实性、引用和任务效用之间调整权重。

CRAG 不要求把整套反思能力训练进生成模型。它先用检索评估器估计返回文档的质量,再根据置信区间采取保留、补充或改用外部搜索等动作;随后提取文档中更相关的知识条目,过滤无关部分并重新组合上下文。

共同思想是把一次性的“检索—生成”改为有状态的决策链。风险则是评估器本身会误判,循环检索会放大延迟和成本,外部搜索还会引入权限、时效、提示注入及不可信来源问题。反思分数只能作为系统信号,不能自动等价于事实正确。

工程实践

生产系统可先实现显式状态机:无需检索 / 检索通过 / 低置信补检 / 冲突或无证据拒答,为每条路径设置最大检索轮数、超时和回退。检索评估器要在真实业务分布上校准阈值,并分别统计误放行和误拒绝;不能只看最终答案平均分。若接入 Web,必须隔离不可信文本、重新执行来源与安全策略,且不能绕过租户 ACL。日志应保存每轮查询、候选、评估分、分支动作及最终引用,避免只留下最终答案而无法审计。

常见追问

  1. Self-RAG 是否等于让普通模型在 Prompt 中“反思一下”? 不等于。原论文训练模型预测专门的检索与批判 Token,并在推理中利用其概率控制生成;Prompt 自检可以借鉴流程,但不是同一训练方法。
  2. CRAG 的检索评估器判断错了怎么办? 需要校准阈值、保留灰区分支并限制纠错动作;高风险问题可要求多来源一致或转人工,不能让单个分数成为无条件事实裁决。
  3. 为什么不对所有问题都检索并多轮反思? 固定检索会给不需要外部知识的问题引入噪声,多轮控制还增加成本和尾延迟;按需检索的目的之一就是在质量与资源之间做选择。
  4. Self-RAG 与 CRAG 可以组合吗? 概念上可以由模型决定何时检索,再由外部评估器检查召回质量,但组合后的阈值、循环终止和收益必须重新评测,不能假定叠加必然提升。

一句话复习

Self-RAG 把按需检索与批判信号训练进生成模型,CRAG 用外部评估器触发检索纠错;二者都要防止评估误判和无限循环。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…