蚂蚁集团面试题更新 2026-08-05

在 DPO 训练中,正负样本通常如何构建?请结合具体场景说明。

蚂蚁集团人工智能互联网/IT数据驱动问题拆解技术原理

考察说明

考察对 DPO 偏好数据构造方法及数据质量把控的理解

回答思路

  1. 说明正负样本定义为(偏好回答,非偏好回答),来源可包括人工标注或模型生成
  2. 介绍多种构造方式:如让强大模型生成对比样本、利用用户反馈或人工评分排序
  3. 强调正负样本应保持可控变量,如长度、风格、内容差异,并注意数据质量与去重