京邦达面试题更新 2026-08-05

请比较 GRPO、PPO 和 DPO 这三种强化学习对齐方法的算法原理与适用场景。

京邦达人工智能物流/供应链技术原理技术选型方案权衡

考察说明

考察对主流 RLHF 算法原理的理解、对比与选型能力

回答思路

  1. 能够准确说出 PPO 的 critic 价值网络与优势估计原理
  2. 能够解释 GRPO 如何去掉 critic 网络并基于组内相对奖励估计优势
  3. 能够说明 DPO 如何将 RL 优化转化为隐式奖励下的直接偏好优化
  4. 能够结合奖励建模、离线/在线、样本效率等维度对比三者适用场景