Skip to content

一句话总结:监控工具四选一——LangSmith(生产调试+评估+人工标注闭环)、Langfuse(开源全栈+成本追踪开箱即用)、Phoenix(本地优先 OTel 原生)、Helicone(LLM 网关代理拦截);核心盯 TTFT/响应时间/每 token 时间,成本按 P95 2x 告警。

四工具对比(面试默写)

工具定位强项
LangSmith框架无关 Agent 工程平台生产调试/评估/审查/自动修复,Annotation Queue(生产 trace 推人工标注)
Langfuse开源全栈(MIT)观测+prompts+evals,成本追踪开箱即用(内置各模型价目表),可自托管
Arize Phoenix本地优先OTel 原生,持续评估+告警,RAG 观测
HeliconeLLM 网关代理拦截+回放,API 级可见性/缓存/路由

关键指标(拉分点)

指标关注点
TTFT(首 token 延迟)感知响应
总响应时间用户体验
每输出 token 时间30-50ms 流畅
错误率2% 阈值(API Key/限流/代码 Bug)
检索命中率切分/Embedding 质量

成本追踪

  • 每请求成本 P95 > 2x 平均 → 查昂贵 prompt
  • 日消费 80% 预算 → 告警
  • 每用户/功能成本 → 找成本驱动

评估集成(深度分)

  • llm-as-a-judge、A/B 测试、prompt 版本对比
  • Annotation Queue:生产 traces → 人工标注 UI——"humans in the eval loop"
  • 注意:tracing 有开销(150-300ms/agent step)——开发禁用或上线前 benchmark;API key 无效时 tracing 静默失败(需加错误处理)

面试要点

  • 能对比四工具(定位+强项)
  • 能报关键指标(TTFT/每 token 时间/错误率 2%)
  • 能讲成本追踪(P95 2x、80% 预算)
  • 能说 tracing 开销与静默失败坑

相关概念

  • [AI-Agent-可观测性与Trace标准](/学习笔记/AI技术/AI Agent/AI-Agent-可观测性与Trace标准) — 标准层
  • [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 评估集成
  • [AI-Agent-生产部署与告警](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署与告警) — 告警联动
  • [AI-Agent-可观测性与评估工程](/学习笔记/AI技术/AI Agent/AI-Agent-可观测性与评估工程) — 概念总览