Appearance
一句话总结:工作流生产化四件套——分层超时(工具 5-10s / LLM 15-30s / 任务级)→ 重试分层(transient 重试、validation 返回 LLM、permission 升级人工、catastrophic 熔断)→ 并发控制(最大并发 + 队列 + 限流)→ 成本护栏(max steps + 预算);一切用 trace_id 串起来。
分层超时(面试默写)
| 层级 | 超时类型 | 推荐值 |
|---|---|---|
| 工具级 | 单次工具调用 | 5-10s(30-60s 宽松版) |
| LLM 级 | 单步模型调用 | 15-30s |
| 步骤级 | LLM+工具整步 | 2-5min |
| 任务级 | 整个任务 | 30-60min |
- 分层 Timeout 链:Request → Agent → LLM → Tool → Database
重试层级(Retry Hierarchy,拉分点)
| 失败类型 | 处理 |
|---|---|
| Transient(网络/限流) | 指数退避重试(2s→4s→8s,最多 3 次) |
| Validation(参数错) | 返回错误给 LLM 纠正 |
| Permission(权限) | 升级人工 |
| Logical(无结果) | 返回空,LLM 决定下一步 |
| Catastrophic(DB down) | 熔断,中止整个任务 |
熔断与并发(拉分点)
- 熔断:某工具频繁失败 → 暂时停止调用 → fallback / 降级
- 并发控制:并行节点设最大并发数(如 5)、队列缓冲超限请求、高成本节点(LLM)单独限流
- 常见坑:串行当并行、并行度无上限、缺少熔断、错误处理分支缺失、盲目重试
成本控制(深度分)
- max steps + 预算 + 熔断——不是靠"更好的 prompt"
- 三层重试(模型推理/工具调用/编排)独立重试会让成本爆炸——要统一护栏
可观测性(深度分)
- 唯一 trace_id 穿透执行树:模型分解子任务 → 检索 RAG 块 → 决定调工具 → 人工审核参数 → checkpoint
- OTel 埋点:基础设施指标 + 应用层(编排逻辑 / Agent 行为 / 模型推理)
- correlation ID + 结构化日志:故障时快速定位根因
面试要点
- 能默写分层超时表
- 能讲重试层级(transient/validation/permission/catastrophic)
- 能报并发控制与成本护栏
- 能说 trace_id 可观测性
相关概念
- [AI-Agent-工作流模式与状态机](/学习笔记/AI技术/AI Agent/AI-Agent-工作流模式与状态机) — 状态层
- [AI-Agent-生产部署与告警](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署与告警) — 部署层
- [AI-Agent-可观测性与Trace标准](/学习笔记/AI技术/AI Agent/AI-Agent-可观测性与Trace标准) — 监控层
- [AI-Agent-多智能体架构与工程化](/学习笔记/AI技术/AI Agent/AI-Agent-多智能体架构与工程化) — 失败处理对照