Appearance
一句话总结:长任务 Agent 的可靠性靠 Checkpoint——每个关键步骤把状态快照落库,崩溃后从断点续跑;恢复能力分四级(会话可恢复→状态可收敛→执行可续跑→副作用可恢复),最后一级保证不重复付款、不重发消息。
为什么需要状态管理
- 长任务场景:批量数据处理、长篇内容生成、多工具联动——一旦 OOM/停机更新,整个任务失败重来
- 解决方案:Checkpoint 机制——Agent Loop 每个关键步骤(思考结束/工具调用完成)把状态快照序列化存持久化存储
- 崩溃后:调度器读最新 Checkpoint,从断点继续,不重跑已完成步骤
检查点保存什么
当前版本 + 已完成步骤 + 输出文件 + 错误记录 + 下一步动作恢复流程:读检查点 → 观察当前环境 → 继续执行
恢复能力四级(面试默写)
| 等级 | 能力 | 崩溃后的表现 |
|---|---|---|
| L1 会话可恢复 | 保存消息/上下文/分支/摘要 | 重启后可重开会话 |
| L2 状态可收敛 | 识别悬空流/工具调用/运行状态 | 不停在 running,变 interrupted/error/待确认 |
| L3 执行可续跑 | 从安全边界重新调度未完成步骤 | 已完成不重跑,未完成继续 |
| L4 副作用可恢复 | 识别外部操作是否已生效 | 不重复付款/发消息/创建工单/执行破坏命令 |
断点续跑三层状态(专业度拉分点)
- 追加式事件日志:完整执行轨迹
- 验收过的阶段快照:过审的中间状态
- 不可重复副作用的幂等边界:外部操作去重(Google Agent Executor 2026 明确此三层)
工程细节
- Checkpoint 兼容性:Backward(新代码读旧 checkpoint)+ Forward(旧代码读新)+ Schema registry 版本迁移
- LangGraph:节点边界自动保存 State 快照,
thread_id恢复(对接 [AI-Agent-框架内部机制](/学习笔记/AI技术/AI Agent/AI-Agent-框架内部机制)) - 升级时双向兼容 + 滚动回滚
面试要点
- 能默写恢复四等级并解释 L4(副作用幂等)
- 能说检查点保存 5 要素与恢复三步
- 能提断点续跑三层状态(事件日志/阶段快照/幂等边界)
- 能讲 Checkpoint 兼容性(schema registry)
相关概念
- [AI-Agent-框架内部机制](/学习笔记/AI技术/AI Agent/AI-Agent-框架内部机制) — LangGraph checkpointer
- [AI-Agent-可观测性与评估工程](/学习笔记/AI技术/AI Agent/AI-Agent-可观测性与评估工程) — 执行轨迹记录
- [AI-Agent-工作流编排](/学习笔记/AI技术/AI Agent/AI-Agent-工作流编排) — 长任务编排
- [AI-Agent-自我反思与改进机制](/学习笔记/AI技术/AI Agent/AI-Agent-自我反思与改进机制) — 失败后的改进闭环