怎样提高 LLM Agent 的可靠性?
先用自己的话答,再看参考说法
60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。
别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。
参考内容当前已显示;开始口述后会暂时隐藏。
面试时怎么答
Agent 可靠性应沿一次任务的失败链来讲:理解可能错、计划可能循环、工具可能失败、结果可能未验证。针对每层分别给出 Schema、步数预算、最小权限、幂等写入、结果校验和人工审批,随后说明重试会放大成本与副作用;面试官通常会追问状态如何恢复。
可以这样答:
Agent 可靠性不能只靠 Prompt,而要把整个执行链做成可约束、可验证、可恢复、可观测。按理解、规划、工具执行和结果验证四层展开:输入输出做 Schema,工具最小权限,写操作保证幂等,关键动作人工确认。不过,重试和更多自主步骤会提高完成机会,也会增加循环、成本与风险。运行时还要设置步数和费用预算,持久化状态,并跟踪任务成功率、工具错误率、人工接管率、P95 延迟和单任务成本。
核心回答
这是一道端到端排查框架题。可靠性不能只靠 Prompt,需要同时约束输入、决策、工具执行和输出。实践中会使用结构化输出与 Schema 校验、最小权限工具、超时和重试、关键操作人工确认、状态持久化,以及覆盖成功和失败路径的评估集。上线后还要记录每一步决策、工具参数与结果,才能定位失败发生在哪一层。
展开说明
Agent 的错误通常可以分为四类:
- 理解错误:意图或上下文识别错误。
- 规划错误:步骤不完整、循环或选择了错误工具。
- 执行错误:参数非法、工具超时、外部系统返回异常。
- 验证错误:没有检查结果就直接宣称任务完成。
对应的防护包括状态机约束、参数白名单、幂等设计、有限重试、结果校验和安全回滚。涉及付款、删除、对外发送等高风险动作时,应把“生成计划”和“真正执行”分开,并增加明确确认。
工程实践
评估时不要只看最终成功率。还应跟踪平均步骤数、工具调用错误率、重复调用率、人工接管率、耗时和单次任务成本,从而区分“偶然做对”和“稳定做对”。
常见追问
- 如何避免 Agent 陷入无限循环? 设置最大步数、时间与费用预算,检测重复状态和重复工具参数;触发边界后应安全终止或转人工。
- 工具调用失败时应该让模型重试几次? 没有固定次数;只对可恢复且幂等的错误做有限指数退避,参数错误先修正,永久错误直接停止。
- 哪些操作必须加入 human-in-the-loop? 付款、删除、授权、对外发送和不可逆基础设施变更等高影响动作,应在展示对象与后果后取得明确确认。
一句话复习
可靠 Agent 来自可约束、可验证、可恢复、可观测的完整执行链路。
参考资料
评论与补充
评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。
正在连接站内评论服务…
正在加载评论…
还没有评论,你可以先写下自己的理解或追问。