Appearance
一句话总结:推理提示三级——Zero-shot CoT("Let's think step by step")低成本默认、Few-shot CoT(2-4 个题目→步骤→答案样例)题型稳时更稳、Self-Consistency(k=5-20 条独立链多数表决)高准确率场景 3-5x 成本;先列假设再推导、结论自我验证是便宜有效的技巧。
推理提示三级(面试默写)
| 方法 | 做法 | 适用 |
|---|---|---|
| Zero-shot CoT | "Let's think step by step" | 默认,低成本 |
| Few-shot CoT | 2-4 个 题目→步骤→答案 高质量样例 | 题型稳定、要模仿风格 |
| Self-Consistency | 高温度采样 k=5-20 条独立推理链 → 答案多数表决 | 高准确率场景 |
- Self-Consistency GSM8K 74%(比标准 CoT +27%)
- 两段式架构:多样生成(N 条候选)→ 聚合裁决(归一化/聚类/投票)→ 封装成 Decoding Policy
何时用 Self-Consistency(拉分点)
| ✅ 适合 | ❌ 不适合 |
|---|---|
| 单一客观答案 | 采样不独立(重复同一错误) |
| 高准确率要求(医疗/法律/金融) | 多数不能证明是事实 |
| 能吸收 3-5x API 成本 | 成本敏感的生产默认 |
- 生产默认:Zero-shot CoT 是准确率与成本的最佳折中
评估指标(深度分)
| 指标 | 测量 |
|---|---|
| 最终准确率 | 标准答案比对 |
| 推理链完整率 | 是否含所有必要步骤 |
| 幻觉率 | 中间步骤错误 |
| Token 效率 | 有效推理步 / token 总数 |
实用技巧
- 先列假设再推导——发现哪步假设错,而非黑盒答案
- 结论自我验证:"请反验证答案是否满足所有原始条件"
面试要点
- 能默写推理提示三级
- 能报 Self-Consistency GSM8K 74%/+27%
- 能讲 SC 适用条件与成本权衡
- 能说评估四指标
相关概念
- [AI-Agent-推理策略与思维链](/学习笔记/AI技术/AI Agent/AI-Agent-推理策略与思维链) — 推理机制层
- [AI-Agent-Prompt-结构化输出与格式约束](/学习笔记/AI技术/AI Agent/AI-Agent-Prompt-结构化输出与格式约束) — 输出配合
- [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 评估落地
- [AI-Agent-自我反思与改进机制](/学习笔记/AI技术/AI Agent/AI-Agent-自我反思与改进机制) — 自我验证