Skip to content

一句话总结:RLVR 用程序化验证器给奖励(数学检查器/代码执行器)——成本低、可扩展、无奖励作弊;GRPO 去掉 critic 用组内相对排名算 advantage(省一半训练算力);DeepSeek-R1 证明纯 RLVR 能涌现推理,2026 已成推理微调默认范式。

RLVR vs RLHF(面试默写)

维度RLHFRLVR
奖励来源参数化奖励模型(人工偏好)确定性验证器(客观对错)
风险噪声/主观/Goodhart/奖励作弊无奖励模型即无奖励作弊
成本高(需标注+训练 RM)低、可大规模自动化
适用细腻人类偏好有客观 ground truth(数学/代码/SQL)

GRPO(组相对策略优化,拉分点)

  • DeepSeek 2024.2 DeepSeekMath 提出;R1-Zero 仅用 GRPO 涌现推理
  • 核心:不训练独立 critic——同一 prompt 采样 G 个回答,组内相对排名做 advantage 估计
  • 优势:省掉 value model(PPO 双倍训练算力)、超参面更简单、per-batch 梯度更干净
  • 奖励:典型二元(0/1),支持连续值

奖励设计(Domain Verifier)

领域验证器奖励
数学最终答案 string/symbolic 匹配对 1 错 0
代码单元测试执行全过 1 否则 0
SQL查询结果比较一致 1
CLI 命令翻译命令+flag 逐项比对精确 +1.0 / 部分按比例

面试要点

  • 能对比 RLHF vs RLVR(奖励来源/风险/成本)
  • 能讲 GRPO(无 critic、组内排名、省算力)
  • 能说 R1 证明纯 RLVR 涌现推理
  • 能报领域验证器设计

相关概念

  • [AI-Agent-模型微调与Agent适配](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调与Agent适配) — 微调总览
  • AI基础概念-大模型预训练与能力涌现 — 涌现机制
  • [AI-Agent-微调评估与回归](/学习笔记/AI技术/AI Agent/AI-Agent-微调评估与回归) — 效果验证
  • [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 指标层