请解释交叉验证的概念,并详细阐述K折交叉验证的执行步骤和原理。
考察说明
考查对模型评估方法中交叉验证的理解,特别是K折交叉验证的具体流程。
回答思路
- 【回答框架 1】交叉验证是一种评估模型泛化能力的技术,通过将数据集划分为训练集和验证集,多次训练并验证模型,最后综合评估性能,以减少因数据划分的随机性而导致的评估偏差。
- 【回答框架 2】K折交叉验证将原始数据随机均分为K个大小相等的子集,每次选择其中一个子集作为验证集,其余K-1个子集作为训练集,训练并评估模型,重复K次,使每个子集都恰好作为验证集一次。
- 【回答框架 3】最终的模型性能评估指标为K次验证结果的平均值,如平均准确率或平均均方误差,这样能更稳定地反映模型在未知数据上的表现,降低单次划分带来的方差。
- 【回答框架 4】K的典型取值为5或10,且通常需要对数据进行分层抽样以保持类别比例一致,尤其在不平衡数据集上更为重要。此外,留一法(LOOCV)是K等于样本数时的特例,计算开销大。
- 【关键点 1】交叉验证用于评估模型泛化能力,减少数据划分随机性影响。
- 【关键点 2】K折交叉验证将数据均分K份,轮流做验证集,最终以平均指标评估。
- 【关键点 3】K常取5或10,分层抽样可保持类别比例。
- 【易错点 1】在数据划分时未进行随机化可能导致顺序偏差。
- 【易错点 2】忽视数据泄露风险,如预处理需在训练折内进行。
- 【易错点 3】对不平衡数据使用简单K折可能导致验证集缺乏少数类样本。