请讲一下 DPO、PPO、GRPO 的原理和区别,并写出 DPO 的 loss 函数。
考察说明
考察对三种主流大模型对齐算法原理的掌握、彼此差异的理解及公式推导能力
回答思路
- 准确阐述 PPO 基于奖励模型和重要性采样的 RLHF 流程
- 清晰解释 GRPO 在 PPO 基础上的改进,如去掉价值网络、组内相对奖励等
- 正确推导并写出 DPO 的 loss 函数,说明其如何隐式优化奖励
- 对比三种算法在数据需求、计算开销、稳定性和适用场景上的差异
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。