Skip to content

一句话总结:推理提示三级——Zero-shot CoT("Let's think step by step")低成本默认、Few-shot CoT(2-4 个题目→步骤→答案样例)题型稳时更稳、Self-Consistency(k=5-20 条独立链多数表决)高准确率场景 3-5x 成本;先列假设再推导、结论自我验证是便宜有效的技巧。

推理提示三级(面试默写)

方法做法适用
Zero-shot CoT"Let's think step by step"默认,低成本
Few-shot CoT2-4 个 题目→步骤→答案 高质量样例题型稳定、要模仿风格
Self-Consistency高温度采样 k=5-20 条独立推理链 → 答案多数表决高准确率场景
  • Self-Consistency GSM8K 74%(比标准 CoT +27%)
  • 两段式架构:多样生成(N 条候选)→ 聚合裁决(归一化/聚类/投票)→ 封装成 Decoding Policy

何时用 Self-Consistency(拉分点)

✅ 适合❌ 不适合
单一客观答案采样不独立(重复同一错误)
高准确率要求(医疗/法律/金融)多数不能证明是事实
能吸收 3-5x API 成本成本敏感的生产默认
  • 生产默认:Zero-shot CoT 是准确率与成本的最佳折中

评估指标(深度分)

指标测量
最终准确率标准答案比对
推理链完整率是否含所有必要步骤
幻觉率中间步骤错误
Token 效率有效推理步 / token 总数

实用技巧

  • 先列假设再推导——发现哪步假设错,而非黑盒答案
  • 结论自我验证:"请反验证答案是否满足所有原始条件"

面试要点

  • 能默写推理提示三级
  • 能报 Self-Consistency GSM8K 74%/+27%
  • 能讲 SC 适用条件与成本权衡
  • 能说评估四指标

相关概念

  • [AI-Agent-推理策略与思维链](/学习笔记/AI技术/AI Agent/AI-Agent-推理策略与思维链) — 推理机制层
  • [AI-Agent-Prompt-结构化输出与格式约束](/学习笔记/AI技术/AI Agent/AI-Agent-Prompt-结构化输出与格式约束) — 输出配合
  • [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 评估落地
  • [AI-Agent-自我反思与改进机制](/学习笔记/AI技术/AI Agent/AI-Agent-自我反思与改进机制) — 自我验证