Appearance
一句话总结:推理时计算 = 用搜索换深度——MCTS 四步循环(选择/扩展/评估/回传)让模型"试错和统计";RAP 用世界模型预判"走这步会怎样"、LATS 把 MCTS 搬进 Agent(WebShop +20%)、Best-of-N 采样取最优。
MCTS 核心(面试默写)
四步循环:
- Selection:从根选最有希望节点
- Expansion:扩展新子节点
- Evaluation:评估节点价值
- Backpropagation:回传更新统计
三个关键范式
| 范式 | 核心 | 亮点 |
|---|---|---|
| RAP(Reasoning via Planning) | 同一 LLM 复用两角色:Agent(策略,生成候选动作)+ World Model(预测下一状态并打分) | 弥补 LLM 没有内部世界模型预判的短板 |
| LATS | MCTS 搬进 Agent:LLM 替代随机模拟、自我评估替代手工价值函数、加 reflection 反思节点 | WebShop +20%、ALFWorld +30% |
| Best-of-N / TreeBoN | 采样 N 个候选取最优;TreeBoN = 树搜索+BoN(好父节点多采样、剪低回报节点) | 推理时对齐,省成本 |
验证器与过程奖励
- 过程奖励模型(PRM):对中间步骤打分——比结果奖励更能定位错误发生在哪一步
- 与结果奖励(ORM)互补:ORM 判断对错,PRM 定位错误
代表应用(面试拉分点)
- RAG-Star:MCTS 搜索子查询路径(检索增强的深思推理)
- Marco-o1-MCTS:动作单元可选步骤级/64-token 微步骤/32-token 微步骤
- I-MCTS:内省式 MCTS 增强 AutoML Agent(反思融入搜索)
代价判断(成熟度分)
- MCTS 类方法 token/延迟成本显著高于单次推理
- 适合:高价值复杂推理(数学/规划/多步决策)——"算力换深度"
- 不适合:简单问答(单次 CoT 足够)
面试要点
- 能默写 MCTS 四步
- 能讲 RAP 双角色(Agent+World Model)
- 能讲 LATS 三处替换(模拟/价值函数/反思)
- 能区分 PRM(定位)vs ORM(判断)并说成本权衡
相关概念
- [AI-Agent-推理策略与思维链](/学习笔记/AI技术/AI Agent/AI-Agent-推理策略与思维链) — 推理基础
- [AI-Agent-规划器与任务分解](/学习笔记/AI技术/AI Agent/AI-Agent-规划器与任务分解) — 规划层
- [AI-Agent-自我反思与改进机制](/学习笔记/AI技术/AI Agent/AI-Agent-自我反思与改进机制) — reflection 节点
- [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 验证器/门禁