AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
在 DPO 训练中,正负样本通常如何构建?请结合…
人工智能面试题
更新 2026-08-05
在 DPO 训练中,正负样本通常如何构建?请结合具体场景说明。
蚂蚁集团
人工智能
互联网/IT
数据驱动
问题拆解
技术原理
考察说明
考察对 DPO 偏好数据构造方法及数据质量把控的理解
回答思路
说明正负样本定义为(偏好回答,非偏好回答),来源可包括人工标注或模型生成
介绍多种构造方式:如让强大模型生成对比样本、利用用户反馈或人工评分排序
强调正负样本应保持可控变量,如长度、风格、内容差异,并注意数据质量与去重
换一题
上一题
在C++中如何阻止一个类被拷贝?
下一题
请解释相机坐标系与世界坐标系之间的转换关系,包括旋转和平移的作用。
本题还出现在
互联网/IT行业面试题
蚂蚁集团面试题