← 返回题库
第 201 题 · 工程实践 · 困难

如何构建可复现的大模型应用评估与回归测试?

核心必会 这代表什么?
✓ 资料核验 来源说明:公开面经高频主题;答案依据论文和官方文档原创整理
Evals回归测试LLM Judge
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

回归评测先按确定性断言、开放回答评分、端到端执行分层,不要拿一个平均分覆盖所有变化。固定集保证可比,滚动坏例集吸收线上事故,隔离盲测集防止过拟合;发布判断应看关键切片的非劣阈值和区间,而不是只看总分上涨。

可以这样答:

大模型回归不能只有一个平均分,要同时覆盖任务能力、可靠性、安全、延迟和成本,并能复现到完整版本。评测分层:结构化输出用确定性断言,开放回答用成对 Judge 加人工抽检,关键流程做端到端执行。不过,Judge 便宜但有位置和长度偏差,人工更可信却难扩展。评测时要维护固定集、滚动坏例集和隔离盲测集,按场景设置非劣阈值,报告置信区间、失败簇、P95 延迟和单任务成本。

核心回答

从真实请求、失败案例和关键业务路径建立版本化黄金评测集(Golden Set),为每条样本保存输入、必要上下文、期望事实或证据、评分准则(Rubric)和错误标签。尽可能固定模型快照、Prompt、检索索引及参数版本后运行基线;托管模型无法完全固定时,应记录实际版本并重复运行估计方差。每次变更在同一数据集上比较质量、延迟、成本和安全指标,并把超过阈值的退化阻断在发布前。

展开说明

评估应分层:

  1. 确定性检查:JSON Schema、必填字段、引用格式、工具参数和规则约束。
  2. 任务指标:分类准确率、检索 Recall@K、任务成功率或人工定义得分。
  3. 语义评审:对开放回答使用 Rubric、成对比较或 LLM Judge。
  4. 在线指标:用户完成率、人工接管率、投诉、p95 延迟和单任务成本。

LLM Judge 是代理评审器,可能受顺序、长度、风格和同源模型偏差影响。需要与人工标注校准,对候选做双向顺序交换并聚合结果,定期抽检分歧样本。

工程实践

测试集要防止泄漏并按场景切片,随机生成任务应重复运行以测稳定性。保存每次请求的输入版本、检索结果、工具轨迹和输出,失败时才能回放。新增 Bad Case 时既加入回归集,也要标注它属于哪一层问题。

常见追问

  1. 没有标准答案的开放问答如何评估? 先定义可观察评分量表,再用成对比较、事实核验与人工抽检组合;重要结论要报告评审一致性。
  2. LLM-as-a-Judge 有哪些常见偏差? 常见有位置、长度、格式、风格和自增强偏差;可交换顺序、多 Judge、校准样本和盲化模型身份缓解。
  3. 如何设置回归测试的发布阈值? 对关键切片设硬门槛,对总体指标设带置信区间的非劣界,同时把延迟、成本和安全指标纳入联合门禁。

一句话复习

可复现评估需要版本化样本、明确 Rubric、分层指标和可回放轨迹,而不只是一个平均分。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…