Appearance
一句话总结:监控工具四选一——LangSmith(生产调试+评估+人工标注闭环)、Langfuse(开源全栈+成本追踪开箱即用)、Phoenix(本地优先 OTel 原生)、Helicone(LLM 网关代理拦截);核心盯 TTFT/响应时间/每 token 时间,成本按 P95 2x 告警。
四工具对比(面试默写)
| 工具 | 定位 | 强项 |
|---|---|---|
| LangSmith | 框架无关 Agent 工程平台 | 生产调试/评估/审查/自动修复,Annotation Queue(生产 trace 推人工标注) |
| Langfuse | 开源全栈(MIT) | 观测+prompts+evals,成本追踪开箱即用(内置各模型价目表),可自托管 |
| Arize Phoenix | 本地优先 | OTel 原生,持续评估+告警,RAG 观测 |
| Helicone | LLM 网关 | 代理拦截+回放,API 级可见性/缓存/路由 |
关键指标(拉分点)
| 指标 | 关注点 |
|---|---|
| TTFT(首 token 延迟) | 感知响应 |
| 总响应时间 | 用户体验 |
| 每输出 token 时间 | 30-50ms 流畅 |
| 错误率 | 2% 阈值(API Key/限流/代码 Bug) |
| 检索命中率 | 切分/Embedding 质量 |
成本追踪
- 每请求成本 P95 > 2x 平均 → 查昂贵 prompt
- 日消费 80% 预算 → 告警
- 每用户/功能成本 → 找成本驱动
评估集成(深度分)
- llm-as-a-judge、A/B 测试、prompt 版本对比
- Annotation Queue:生产 traces → 人工标注 UI——"humans in the eval loop"
- 注意:tracing 有开销(150-300ms/agent step)——开发禁用或上线前 benchmark;API key 无效时 tracing 静默失败(需加错误处理)
面试要点
- 能对比四工具(定位+强项)
- 能报关键指标(TTFT/每 token 时间/错误率 2%)
- 能讲成本追踪(P95 2x、80% 预算)
- 能说 tracing 开销与静默失败坑
相关概念
- [AI-Agent-可观测性与Trace标准](/学习笔记/AI技术/AI Agent/AI-Agent-可观测性与Trace标准) — 标准层
- [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 评估集成
- [AI-Agent-生产部署与告警](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署与告警) — 告警联动
- [AI-Agent-可观测性与评估工程](/学习笔记/AI技术/AI Agent/AI-Agent-可观测性与评估工程) — 概念总览