AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
京邦达面试题
请比较 GRPO、PPO 和 DPO 这三种强化…
京邦达面试题
更新 2026-08-05
请比较 GRPO、PPO 和 DPO 这三种强化学习对齐方法的算法原理与适用场景。
京邦达
人工智能
物流/供应链
技术原理
技术选型
方案权衡
考察说明
考察对主流 RLHF 算法原理的理解、对比与选型能力
回答思路
能够准确说出 PPO 的 critic 价值网络与优势估计原理
能够解释 GRPO 如何去掉 critic 网络并基于组内相对奖励估计优势
能够说明 DPO 如何将 RL 优化转化为隐式奖励下的直接偏好优化
能够结合奖励建模、离线/在线、样本效率等维度对比三者适用场景
换一题
上一题
Integer和int有什么区别?它们能直接用 == 比较吗?
下一题
如何判断一个链表是否有环?请说明算法思路。
本题还出现在
物流/供应链行业面试题
人工智能面试题