团队的 AI 评测集越做分数越高,但你怀疑模型只是被反复调到了这批题上。你会怎样治理评测集?
考察说明
考查评测数据版本、污染和泛化治理能力。
回答思路
- 把开发集、回归集和最终验收集分开管理,限制最终验收样本的可见范围,避免所有调优都围绕同一批题展开。
- 记录样本来源、用户分层、风险等级、标注依据和版本,确保分数变化能追溯到数据或系统的具体变更。
- 定期从近期真实流量抽取未见过的任务,并保留自然噪声、长尾表达和失败场景,防止评测集逐渐变成标准答案考试。
- 检查相似问题、模板改写和训练材料是否泄漏到验收集,对高度近似样本去重并单独报告可能的数据污染。
- 总体分之外必须查看场景和风险分层,某个高频模板提升不能掩盖新用户或高风险任务的明显退化。
- 评测集扩充要经过标注复核和冻结流程,线上事故样本加入后仍保留事故前基线,便于判断修复是否过拟合。