如何设计多模型路由、升级与故障降级?
先用自己的话答,再看参考说法
60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。
别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。
参考内容当前已显示;开始口述后会暂时隐藏。
面试时怎么答
模型路由与 Fallback 要分开讲:路由是在质量和安全约束下选成本/延迟更合适的模型,Fallback 是依赖失败后的语义降级。说明规则、分类器和级联的升级条件,并区分超时、限流、低置信与安全拒绝;安全拒绝绝不能无条件换模型绕过。
可以这样答:
模型路由不是简单按问题难度选模型,而是在质量与安全约束下优化成本和延迟;Fallback 也必须保持业务语义。我会把语言、任务类型、上下文长度、工具需求、租户策略和实时负载作为特征,先规则再学习路由。不过,小模型先答会省钱,但误判会增加二次调用和尾延迟。可以先用离线反事实集校准升级阈值,再在线上观察路由准确率、升级率、任务成功率、P95 延迟和每成功任务成本。
核心回答
路由分两层:先用确定性策略按数据驻留、模型能力、上下文上限、工具支持和安全等级筛出“可用模型集合”,再在集合内根据任务类型、质量、延迟、实时健康和预算选择模型。简单任务可以默认走较小模型,低置信或高风险任务升级到强模型;供应商超时或限流时只降级到语义与合规要求兼容的候选,而不是随便换一个能返回文本的接口。
路由器本身也要评测和版本化。核心指标不是小模型占比,而是满足质量门槛后的成本、延迟和失败率。
展开说明
一条可解释的决策链通常包括:
- 根据租户、地区、敏感级别和所需模态做硬过滤。
- 用规则、轻量分类器或学习型 router 预测任务类别或“大模型相对收益”。
- 在截止时间与预算内选择候选;必要时由小模型先答,再由验证器决定是否升级。
- 对超时、429 和 5xx 使用有界重试、退避、熔断和备用端点,整个链路共享总 deadline 与 retry budget。
多轮会话通常需要版本或能力粘性,否则工具格式和行为可能在中途改变。Fallback 还要统一错误语义、token 计费和内容安全,不能因为主模型故障而绕过护栏。
工程实践
用生产任务切片建立每个候选模型的质量—成本—延迟曲线,再离线回放路由决策并计算误路由代价。线上记录候选集合、选中原因、升级原因和最终结果;为路由器设置 bypass 开关,可在异常时固定到已知稳定模型。故障演练覆盖单供应商不可用、延迟升高、配额耗尽和响应 Schema 不兼容。
常见追问
- 任务“难度”为什么不是模型路由的唯一特征? 上下文长度、语言、工具能力、数据驻留、租户合规、实时负载和价格都可能形成硬约束,不能被难度分数覆盖。
- 小模型先答、大模型兜底时,如何决定是否升级? 结合结构校验、置信信号、检索证据、任务风险和预算设阈值,并用离线反事实与线上实验校准。
- Fallback 为什么可能成功返回,却造成业务故障? 备用模型可能缺少工具、结构化输出或合规能力;HTTP 成功不等于满足原任务契约,必须做语义级验收。
一句话复习
先按安全与能力做硬过滤,再在合格候选中优化质量、延迟和成本,并让降级遵守同一业务契约。
参考资料
评论与补充
评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。
正在连接站内评论服务…
正在加载评论…
还没有评论,你可以先写下自己的理解或追问。