数据岗位面试题更新 2026-08-05

在数据分析场景下,请说明决策树与随机森林分别如何用于分类任务和回归任务,并比较两者的适用情况。

数据技术原理技术选型方案权衡

考察说明

考查对决策树与随机森林在分类和回归中原理、差异及适用场景的理解。

回答思路

  1. 【回答框架 1】决策树通过递归划分特征空间,每个叶节点对应一个预测结果;分类时叶节点输出类别(常用基尼指数或信息增益选择划分),回归时叶节点输出该区域目标均值(常用均方误差最小化选择划分)。
  2. 【回答框架 2】随机森林是集成学习方法,通过自助采样生成多棵决策树,每棵树在随机特征子集上训练;分类时多数投票,回归时取平均,从而降低单棵树的方差,减少过拟合。
  3. 【回答框架 3】分类任务中,决策树易过拟合且对噪声敏感,随机森林通过集成和特征随机性提升泛化能力;回归任务中,随机森林能捕捉非线性关系,但预测值不会超出训练目标范围,且对极端值敏感。
  4. 【回答框架 4】适用场景上,决策树适合需要可解释性、数据量小或特征少的情况;随机森林适合数据量大、特征多、对精度要求高且可接受一定黑盒性的场景。
  5. 【回答框架 5】实际使用时需注意:随机森林的树数量和最大深度需调参,特征重要性可辅助特征选择,但类别不平衡时需结合采样或权重策略。
  6. 【关键点 1】决策树分类用基尼指数或信息增益,回归用均方误差最小化。
  7. 【关键点 2】随机森林通过自助采样和随机特征子集降低方差,分类投票、回归平均。
  8. 【关键点 3】随机森林通常比单棵决策树泛化能力更强,但可解释性下降。
  9. 【关键点 4】回归时随机森林预测值受训练目标范围限制,对极端值敏感。
  10. 【关键点 5】决策树适合小数据和高解释性需求,随机森林适合大数据和高精度需求。
  11. 【易错点 1】不能认为随机森林一定优于决策树,在小样本或强线性关系下决策树可能更合适。
  12. 【易错点 2】随机森林回归不能外推超出训练目标范围的值。
  13. 【易错点 3】忽略调参直接使用默认参数可能导致性能不佳,需结合交叉验证。