科大讯飞面试题更新 2026-08-05
在强化学习中,Q学习算法选择Q值最大的动作存在哪些缺点?
科大讯飞人工智能专业服务风险判断技术原理方案权衡
考察说明
考察对Q学习贪婪策略局限性的理解,包括探索与利用平衡和过估计问题
回答思路
- 能指出贪婪选择导致探索不足,可能收敛到次优策略
- 能说明Q值过估计(overestimation)及其对策略的影响
- 能讨论缓解方法,如ε-greedy、Double DQN
- 能联系实际强化学习任务说明后果
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。