科大讯飞面试题更新 2026-08-05

在强化学习中,Q学习算法选择Q值最大的动作存在哪些缺点?

科大讯飞人工智能专业服务风险判断技术原理方案权衡

考察说明

考察对Q学习贪婪策略局限性的理解,包括探索与利用平衡和过估计问题

回答思路

  1. 能指出贪婪选择导致探索不足,可能收敛到次优策略
  2. 能说明Q值过估计(overestimation)及其对策略的影响
  3. 能讨论缓解方法,如ε-greedy、Double DQN
  4. 能联系实际强化学习任务说明后果
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。