AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
京东面试题
在LLM训练中,你是如何构造数据集来训练奖励模型…
京东面试题
更新 2026-08-05
在LLM训练中,你是如何构造数据集来训练奖励模型或使用DPO的?
京东
人工智能
电商
数据驱动
问题拆解
技术原理
LLM
考察说明
考察数据集构造方法及其对训练稳定性的影响
回答思路
说明数据集来源、规模和清洗策略
解释偏好数据(chosen/rejected)的构造逻辑
讨论数据质量对训练收敛的影响
换一题
上一题
如何通过原子操作或中间件(如 Redis 锁)避免超卖?
下一题
请介绍几种实现CSS水平垂直居中的方法。
本题还出现在
电商行业面试题
人工智能面试题