Skip to content

一句话总结:Agent 面试的底层就三件事——手撕 ReAct 循环、讲清选型与避坑、会做系统设计;把 22 道高频题归成 6 块逐一击破,用"经验值 + 分层方案"回答,就与背八股的人拉开差距。

考点地图(6 块对应高频题)

板块核心考点对应问题
概念架构Agent vs LLM、五大模块(感知/记忆/规划/决策执行/反思反馈)什么是 Agent
推理模式手写 ReAct、ReAct vs P&E vs Reflection、任务拆分Q4-Q7
工具调用好工具定义、工具幻觉、并行调用、分层错误Q8-Q9
RAG 与记忆Chunk 策略、上下文压缩、长短期记忆设计Q13-Q14
评估可观测Eval 三层、无 Tracing 排障、Token SpikeQ15-Q16
系统设计手机端架构、失败兜底分级、多 Agent 通信场景设计题

最高频手撕:ReAct 核心循环

  • 格式:Thought → Action → Action Input →(工具结果回注)→ 循环 → Final Answer;或用 Tool Calling 结构化输出
  • max_iterations 的作用:防无限循环与 Token 爆炸——死循环一次对话可消耗数百万 Token
  • 并行 Tool Calling:工具无依赖时 LLM 一次生成多个 tool_callasyncio.gather 并发执行
  • 错误自纠:工具报错作为新 Observation 回注,让模型分析原因、修正参数重试——白板题常考
python
# 骨架(面试默写级别)
for step in range(max_iterations):
    resp = llm(messages)
    if resp 是 Final Answer: return resp
    result = execute_tool(resp)      # try/except 包住,错误转 Observation
    messages.append(tool_result(result))
return "无法完成,请简化需求"

推理模式选型(讲清比背定义值钱)

维度ReActPlan-and-Execute
执行方式边想边做先定完整计划再执行
灵活性高,随时改方向低,计划后不易变
长任务易跑偏/死循环结构清晰
错误恢复天然支持需重规划机制
开销无显式规划成本计划期多耗 Token

选型口诀:订票类多步依赖 → ReAct;周报/多文件重构 → P&E;研究探索/Debug → ReAct。生产常用混合:先 High-Level Plan,每步用 ReAct 细粒度决策,阻塞时允许重规划(Plan-and-Solve + ReAct)。

工具调用避坑(带经验值)

  • 工具从 5 个增到 20 个,Tool Calling 准确率约 95% → 75-80%;每级 5-8 个分组可恢复 90%+
  • 多细粒度工具封装成粗粒度工具、内部二次路由
  • 工具错误信息就是新 Observation:错误消息写得能自纠,Agent 才智能
  • 只重试幂等调用(防重复副作用);写入类操作人工确认 + 审计

死循环与失败兜底

死循环 4 表现:反复同工具换参;工具互调;报错→重试死循环;只推理不行动。

恢复阶梯:Prompt Intervention(提示换方向)→ 上下文截断 → 强制摘要重启 → 降级纯问答 → 转人工。

生产绝对兜底:达最大轮次 / Token 预算上限 → 强制结束并回复"当前无法完成,请尝试简化您的需求"或转人工。

幻觉与缓解

  • 工具幻觉:调用了不存在的工具/参数
  • 行动幻觉:以为调用了工具,实际没执行
  • 缓解六手段:Tool Calling+结构化输出 / 约束解码(JSON Schema/GBNF)/ RAG 提供事实上下文 / Self-Consistency 多路验证 / Confidence Scoring(低分不展示)/ HITL(支付、删除等关键决策人工确认)

RAG 与记忆(常背的一组参数)

  • Chunk Size 256-512 tokens、Overlap 10-20%、Top-K 3-5;加一层 Rerank 显著提升质量;代码与自然语言文档用不同 Chunk 策略
  • 上下文窗口满了:Token 预算分配(每轮上限如 20K)+ 强制摘要压缩 + 分层记忆(短期对话 / 长期向量库 / 超长期知识图谱)
  • 高频追问:向量库怎么选型、记忆冗余怎么解决、召回怎么优化

Eval 三层体系与排障

Eval 三层:单元级(工具/单步正确性)→ 轨迹级(整条 reasoning 轨迹质量)→ 端到端(任务成功率 + 成本 + 延迟)。

排障核心认知:Agent 输出不确定,不能像 Debug 代码一样排;没有 Tracing 就是盲人摸象——上线前必须接 LangSmith/LangFuse(最重要的基础设施投资)。

Token Spike 四排查:Tool Loop?工具返回巨量数据?问题超出模型能力?System Prompt / Tool 定义太大?

系统设计套路(场景题答题框架)

  • 手机端 Agent 架构:端侧做意图分类 + 简单问答 + 工具路由,云端做复杂推理 + 长文本生成;关键数据(通讯录/短信)不离开设备;DataStore/Room 会话持久化
  • 失败兜底分级:重试(指数退避)→ 降级(备用模型/简化路径)→ 人工接管——答出分级 = 有生产经验
  • 多 Agent 警示:3 个以上协调成本指数上升;一个 Agent + 好 Prompt 能解决的不拆(过度设计);Agent 通信用结构化协议(定义消息 Schema)+ 超时机制 + 共享上下文(黑板)
  • 安全分层:System Prompt 禁止写操作 → Tool 内部 SQL 解析(拒 DELETE/DROP/TRUNCATE)→ 写操作二次确认 + 审计日志

答题心法

  • 每个方案都要能说出代价(延迟、Token、协调成本)——"代价意识"是拉分点
  • 多引用经验值(95%→75-80%、256-512、Top-K 3-5)证明上过线
  • 系统设计先分层再讲细节:端侧/云端、短期/长期、重试/降级/人工

一句话总结

Agent 面试考的不是记忆,是"循环理解 + 选型直觉 + 生产兜底":能默写 ReAct 骨架、能报出工具数量与准确率曲线、能把失败兜底分成三级,就超过了大部分候选人。

相关概念

  • [AI-Agent-实战教程](/学习笔记/AI技术/AI Agent/AI-Agent-实战教程) — 手写循环与生产化的完整落地
  • [AI-Agent-工具调用](/学习笔记/AI技术/AI Agent/AI-Agent-工具调用) — 错误分类与重试策略
  • [AI-Agent-工作流编排](/学习笔记/AI技术/AI Agent/AI-Agent-工作流编排) — Workflows vs Agents、设计模式
  • [AI-Agent-评估评测](/学习笔记/AI技术/AI Agent/AI-Agent-评估评测) — Eval 体系细节
  • [AI-Agent-安全](/学习笔记/AI技术/AI Agent/AI-Agent-安全) — 提示注入与分层防御
  • [AI-Agent-记忆系统](/学习笔记/AI技术/AI Agent/AI-Agent-记忆系统) — 长短期记忆设计