← 返回题库
第 087 题 · 系统设计 · 困难

大模型上线如何设计 A/B 测试并避免护栏指标退化?

核心必会 这代表什么?
✓ 资料核验 来源说明:公开面经题库主题;公司归属未独立核验,技术答案依据原论文或官方文档整理
A/B 测试在线评测灰度发布
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

A/B 测试的主线是实验设计而非模型原理:按用户稳定分桶,预先写主指标、护栏、最小有意义提升和停止规则,先用 A/A 检查分流与 SRM。点击和停留未必代表回答正确,所以要结合任务完成、盲评、投诉、成本和安全;别在每天偷看后随意提前结束。

可以这样答:

A/B 测试应按用户而不是单请求稳定分桶,避免同一用户来回看到两个模型;实验前写清主指标、成本和安全护栏、最小提升与停止规则,先做小流量 A/A 检查分流,再逐级放量。LLM 的点击、停留可能有歧义,所以会结合任务完成、盲评和投诉。每天先查样本比例异常,再看质量、P99、错误率和单请求成本;任一安全或稳定性护栏越线立即回滚。

核心回答

LLM A/B 测试应先确定随机化单元,通常按用户或组织稳定分桶,避免跨版本污染。实验前定义唯一主指标、次要诊断指标、不可退化护栏、最小可检测效应和持续时间;发布采用影子、内部、1%、10%、50% 等阶段,并保证可一键回滚。

首先验证日志和流量分配,检查 Sample Ratio Mismatch。质量指标要尽量接近真实任务成功,并补充人工盲评;同时监控安全事件、拒答、投诉、错误率、TTFT/P99、Token 与 GPU 成本。频繁看数提前停会膨胀假阳性,应使用预定周期或合适的序贯方法。

展开说明

模型切换可能改变回答长度、交互轮数与工具调用,因此每会话成本和任务完成比单次请求指标更可靠。对有网络效应或组织共享知识的产品,应按组织而非用户随机。高风险动作不能仅依赖实验平均值,即使总体显著提升,只要严重安全事件或最差切片退化,也应阻断放量。

工程实践

所有请求记录实验 ID、分桶、模型和 Prompt 版本,但不在日志中保存不必要的敏感正文。先跑 A/A 验证指标方差和 SRM,再做小流量 Canary。仪表盘区分意图、语言、设备和新老用户,并将回滚条件固化为自动告警;实验结束保存分析代码和决策记录。

常见追问

  1. 为什么不按请求随机? 同一用户可能在会话内跨版本,体验和状态相互污染;按用户稳定分流更符合独立实验单元。
  2. 什么是 Sample Ratio Mismatch? 实际进入各组的样本比例显著偏离设计比例,常提示分桶、曝光或日志丢失问题,此时效果结论不可信。
  3. 质量提升但成本增加怎么办? 预先定义单位成本允许的最小质量收益,比较每成功任务成本;超过预算护栏则优化路由或不全量发布。

一句话复习

LLM A/B 要稳定分桶、先验定义指标与停止规则,并让质量、安全、延迟和成本共同决定是否放量。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…