← 返回题库
第 172 题 · RAG · 简单

RAG 与微调应该如何选择?

核心必会 这代表什么?
✓ 资料核验 来源说明:公开面经高频主题;答案依据论文和官方文档原创整理
RAG微调技术选型
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

先按要改变的东西判断:需要补充频繁更新、可引用的外部知识,优先 RAG;需要改变回答风格、格式、任务行为或稳定指令遵循,考虑微调。模型参数和外部知识库不是同一种存储。

如果对方问能否结合,答案是常常需要:微调让模型学会使用证据或特定输出协议,RAG 提供最新事实。再分别说维护与评测成本即可。

可以这样答:

RAG 更适合注入会更新、需要权限控制和可追溯的知识,因为文档改动不必重新训练;微调更适合改变模型行为,例如固定格式、领域表达、工具调用或任务策略。微调不能保证精确记住并及时更新大量事实,RAG 也不会自动教会模型新的行为模式。很多系统会组合两者:微调负责“怎么答”,检索负责“依据什么答”,并分别评估检索质量和任务成功率。

核心回答

需要频繁更新、可引用、可按权限访问的外部知识时优先 RAG;需要改变模型的回答风格、固定格式、任务习惯或领域表达时考虑微调。RAG 改的是推理时上下文,微调改的是模型参数。很多生产系统会组合两者,而不是二选一。

展开说明

可以从四个问题判断:

  1. 知识是否经常变化:产品、政策和内部文档频繁更新时,RAG 更容易增删和回滚。
  2. 是否需要证据:需要展示出处、审计回答依据时,RAG 更自然。
  3. 问题是知识不足还是行为不稳:需要更新、可追溯的外部事实时通常优先 RAG;格式、语气和任务执行习惯不稳定可用 SFT / LoRA。
  4. 延迟与成本预算:RAG 增加检索和上下文 token;微调增加训练、版本和回归成本。

长上下文也不是自动替代 RAG:它减少了检索步骤,但会增加 token 成本,并可能受无关信息和“中间位置利用不足”影响。

工程实践

先做最小实验:Prompt 基线、RAG 基线和小规模微调分别使用同一评估集比较。若 RAG 已能解决事实问题,就不要为了“让模型记住文档”盲目微调;若检索证据正确但输出格式总出错,再考虑微调行为。

常见追问

  1. 哪些需求适合同时使用 RAG 和 LoRA? 用 RAG 提供可更新、可引用的企业事实,用 LoRA 教模型领域术语、输出格式和如何忠实使用证据,两者职责互补。
  2. 为什么不能把企业知识全部微调进模型? 参数记忆难保证精确召回、更新和删除,也缺少权限过滤与引用血缘;微调还可能把敏感事实扩散到不应出现的上下文。
  3. 长上下文和 RAG 的边界在哪里? 语料很小且一次任务确需全局阅读时可直接长上下文;库大、频繁更新或需权限与引用时,RAG 更可控,二者也可组合。

一句话复习

RAG 适合更新知识和提供证据,微调适合改变稳定行为,两者可以组合。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…