AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
蚂蚁集团面试题
在 DPO 训练中,正负样本通常如何构建?请结合…
蚂蚁集团面试题
更新 2026-08-05
在 DPO 训练中,正负样本通常如何构建?请结合具体场景说明。
蚂蚁集团
人工智能
互联网/IT
数据驱动
问题拆解
技术原理
考察说明
考察对 DPO 偏好数据构造方法及数据质量把控的理解
回答思路
说明正负样本定义为(偏好回答,非偏好回答),来源可包括人工标注或模型生成
介绍多种构造方式:如让强大模型生成对比样本、利用用户反馈或人工评分排序
强调正负样本应保持可控变量,如长度、风格、内容差异,并注意数据质量与去重
换一题
上一题
线程池有哪些关键参数
下一题
有了解过标准的RAG请求分为哪几步吗?
本题还出现在
互联网/IT行业面试题
人工智能面试题