Skip to content

一句话总结:工作流生产化四件套——分层超时(工具 5-10s / LLM 15-30s / 任务级)→ 重试分层(transient 重试、validation 返回 LLM、permission 升级人工、catastrophic 熔断)→ 并发控制(最大并发 + 队列 + 限流)→ 成本护栏(max steps + 预算);一切用 trace_id 串起来。

分层超时(面试默写)

层级超时类型推荐值
工具级单次工具调用5-10s(30-60s 宽松版)
LLM 级单步模型调用15-30s
步骤级LLM+工具整步2-5min
任务级整个任务30-60min
  • 分层 Timeout 链:Request → Agent → LLM → Tool → Database

重试层级(Retry Hierarchy,拉分点)

失败类型处理
Transient(网络/限流)指数退避重试(2s→4s→8s,最多 3 次)
Validation(参数错)返回错误给 LLM 纠正
Permission(权限)升级人工
Logical(无结果)返回空,LLM 决定下一步
Catastrophic(DB down)熔断,中止整个任务

熔断与并发(拉分点)

  • 熔断:某工具频繁失败 → 暂时停止调用 → fallback / 降级
  • 并发控制:并行节点设最大并发数(如 5)、队列缓冲超限请求、高成本节点(LLM)单独限流
  • 常见坑:串行当并行、并行度无上限、缺少熔断、错误处理分支缺失、盲目重试

成本控制(深度分)

  • max steps + 预算 + 熔断——不是靠"更好的 prompt"
  • 三层重试(模型推理/工具调用/编排)独立重试会让成本爆炸——要统一护栏

可观测性(深度分)

  • 唯一 trace_id 穿透执行树:模型分解子任务 → 检索 RAG 块 → 决定调工具 → 人工审核参数 → checkpoint
  • OTel 埋点:基础设施指标 + 应用层(编排逻辑 / Agent 行为 / 模型推理)
  • correlation ID + 结构化日志:故障时快速定位根因

面试要点

  • 能默写分层超时表
  • 能讲重试层级(transient/validation/permission/catastrophic)
  • 能报并发控制与成本护栏
  • 能说 trace_id 可观测性

相关概念

  • [AI-Agent-工作流模式与状态机](/学习笔记/AI技术/AI Agent/AI-Agent-工作流模式与状态机) — 状态层
  • [AI-Agent-生产部署与告警](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署与告警) — 部署层
  • [AI-Agent-可观测性与Trace标准](/学习笔记/AI技术/AI Agent/AI-Agent-可观测性与Trace标准) — 监控层
  • [AI-Agent-多智能体架构与工程化](/学习笔记/AI技术/AI Agent/AI-Agent-多智能体架构与工程化) — 失败处理对照