线上用户报告 Agent 偶发“卡住”,但普通应用日志看不出原因。你会为 Agent 系统补哪些可观测能力?
考察说明
考查跨模型、检索和工具链路的追踪与故障定位能力。
回答思路
- 为一次用户任务建立统一追踪标识,把模型请求、检索、工具调用、重试和状态变更记录成按时间关联的链路。
- 每个步骤记录使用的模型、提示与工具版本、输入输出大小、耗时、状态码和终止原因,敏感内容则进行脱敏或受控采样。
- 指标至少区分首字延迟、完整任务延迟、各工具错误率、循环步数、令牌与费用、人工接管率和任务成功率。
- 建立失败分类,例如模型未按格式输出、工具超时、权限拒绝、状态冲突、达到步骤上限和安全策略拦截,避免全部归为未知错误。
- 告警应结合错误比例、持续时间和业务影响,单次可恢复波动与批量高风险失败采用不同响应级别。
- 在保护用户数据的前提下提供故障回放或确定性模拟能力,使团队能够用当时的版本、状态和工具结果复现问题。