Appearance
一句话总结:Agent 上线走 shadow → 金丝雀(1%/5%)→ 指标对比 → 自动回滚,对照任务成功率/P99/单任务成本;监控大盘盯可用性/错误率/任务完成率,告警分级 P0-P3,外加成本护栏与漂移检测——从"本地能跑"到"生产可用"的最后一公里。
上线前检查(面试默写)
- 稳定性:限流 / 降级 / 熔断 / 超时 / 幂等
- 成本:用量与预算告警
- 可观测:trace / 日志 / 指标
- 安全:权限与审计
- 兜底:人工兜底规则(Agent 失控可接管)
金丝雀发布(拉分点)
shadow(影子流量)→ 1%/5% 真实流量 → 实时监控 → 达标全量 / 偏离回滚| 项 | 规则 |
|---|---|
| 对照指标 | 任务成功率 / 工具调用成功率 / P99 延迟 / 单任务成本 |
| 晋级条件 | 金丝雀指标 ≥ 稳定版 × 0.98 且无新增告警 |
| 回滚条件 | 成功率跌幅 > 3% 或 P0 bad case → 一键切回 stable |
- eval 套件持续跑在 canary 上
监控大盘与告警分级
| 级别 | 触发 | 通知 |
|---|---|---|
| P0 | 服务不可用 | 电话+短信+群 |
| P1 | 错误率 10% | 短信+群 |
| P2 | 延迟上升 50% | 群 |
| P3 | 异常模式 | 邮件 |
- 大盘指标:可用性(实时)/ 错误率(1% 阈值)/ 超时率(0.5%)/ 任务完成率 / 平均工具调用次数 / 用户满意度
成本护栏与漂移(深度分)
- 成本护栏:单任务成本 p95×2 或 $2 → 熔断该任务类型;小时总成本 = 日预算/10 → 触发护栏
- 漂移检测:Agent 是否与上周行为一致——模型更新/工具变更/RAG 语料更新/system prompt 修改/异常输入均可能引起;看异常率、输出长度分布、工具调用模式,任一 20% 跳变即深查
面试要点
- 能默写上线检查五类(稳定/成本/可观测/安全/兜底)
- 能画金丝雀流程(shadow→1%/5%→对比→回滚)
- 能报晋级/回滚条件(×0.98 / 跌幅 3%)
- 能讲告警分级 P0-P3 与成本护栏
- 能说漂移检测(20% 跳变)
相关概念
- [AI-Agent-可观测性与Trace标准](/学习笔记/AI技术/AI Agent/AI-Agent-可观测性与Trace标准) — 观测层
- [AI-Agent-监控工具与平台](/学习笔记/AI技术/AI Agent/AI-Agent-监控工具与平台) — 工具层
- [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 质量门禁
- [AI-Agent-长任务执行与状态管理](/学习笔记/AI技术/AI Agent/AI-Agent-长任务执行与状态管理) — 稳定性关联