京东面试题更新 2026-08-05

在LLM训练中,你是如何构造数据集来训练奖励模型或使用DPO的?

京东人工智能电商数据驱动问题拆解技术原理LLM

考察说明

考察数据集构造方法及其对训练稳定性的影响

回答思路

  1. 说明数据集来源、规模和清洗策略
  2. 解释偏好数据(chosen/rejected)的构造逻辑
  3. 讨论数据质量对训练收敛的影响