Appearance
一句话总结:RLVR 用程序化验证器给奖励(数学检查器/代码执行器)——成本低、可扩展、无奖励作弊;GRPO 去掉 critic 用组内相对排名算 advantage(省一半训练算力);DeepSeek-R1 证明纯 RLVR 能涌现推理,2026 已成推理微调默认范式。
RLVR vs RLHF(面试默写)
| 维度 | RLHF | RLVR |
|---|---|---|
| 奖励来源 | 参数化奖励模型(人工偏好) | 确定性验证器(客观对错) |
| 风险 | 噪声/主观/Goodhart/奖励作弊 | 无奖励模型即无奖励作弊 |
| 成本 | 高(需标注+训练 RM) | 低、可大规模自动化 |
| 适用 | 细腻人类偏好 | 有客观 ground truth(数学/代码/SQL) |
GRPO(组相对策略优化,拉分点)
- DeepSeek 2024.2 DeepSeekMath 提出;R1-Zero 仅用 GRPO 涌现推理
- 核心:不训练独立 critic——同一 prompt 采样 G 个回答,组内相对排名做 advantage 估计
- 优势:省掉 value model(PPO 双倍训练算力)、超参面更简单、per-batch 梯度更干净
- 奖励:典型二元(0/1),支持连续值
奖励设计(Domain Verifier)
| 领域 | 验证器 | 奖励 |
|---|---|---|
| 数学 | 最终答案 string/symbolic 匹配 | 对 1 错 0 |
| 代码 | 单元测试执行 | 全过 1 否则 0 |
| SQL | 查询结果比较 | 一致 1 |
| CLI 命令翻译 | 命令+flag 逐项比对 | 精确 +1.0 / 部分按比例 |
面试要点
- 能对比 RLHF vs RLVR(奖励来源/风险/成本)
- 能讲 GRPO(无 critic、组内排名、省算力)
- 能说 R1 证明纯 RLVR 涌现推理
- 能报领域验证器设计
相关概念
- [AI-Agent-模型微调与Agent适配](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调与Agent适配) — 微调总览
- AI基础概念-大模型预训练与能力涌现 — 涌现机制
- [AI-Agent-微调评估与回归](/学习笔记/AI技术/AI Agent/AI-Agent-微调评估与回归) — 效果验证
- [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 指标层