数据岗位面试题 · 性能优化
题库中标记为“数据”的结构化面试题。
共 3928 道真题 · 当前筛选命中 514 道 · 更新 2026-08-05
筛选题目已选:性能优化
考察点
技术栈
第 41 题请描述你进行离线数仓开发的主要步骤,并说明每一步的关键要点。 考察离线数仓分层建模与调度管理的规范性第 42 题MapReduce比Spark差在哪? 考察对大数据计算引擎差异的理解,以及性能瓶颈和适用场景的分析能力第 43 题一般什么情况下应该为数据库表建索引? 考察索引设计的基本场景判断与合理取舍第 44 题在亿级用户场景下计算多个 n 日留存,如何减少关联(Join)开销? 考察大规模留存计算中降低 Join 成本的优化思路与工具选型第 45 题如果离线数据处理遇到数据倾斜,你会如何处理? 考察对数据倾斜成因的理解与系统性解决方案第 46 题你提到了数据倾斜,请谈谈你了解哪些数据倾斜及其处理方式。 考察对数据倾斜成因、影响和解决方案的理解第 47 题请设计一个复杂SQL查询,要求高效处理多表关联与分组聚合,请说明你的思路和关键优化点。 考察复杂SQL问题的拆解、关联逻辑理解与性能优化意识第 48 题请介绍你在实习经历中做过的一次 SQL 优化工作,具体是如何进行的? 考察候选人 SQL 优化方法论与实际执行能力第 49 题请谈谈你在Spark任务中是如何进行性能调优的,特别是遇到数据倾斜时你会怎么处理? 考察对Spark性能瓶颈的识别能力以及数据倾斜问题的系统性解决方案第 50 题离线数仓中有大任务,你通常如何优化其性能? 考察大任务性能分析与资源优化能力第 51 题如何进行数据库 SQL 调优? 考察 SQL 优化方法论、索引使用和具体调优手段第 52 题怎么评估分散链路和 one rec 链路的效率? 考察对推荐系统中不同处理链路效率评估的方法论与指标体系第 53 题union和union all的区别是什么? 考察数据库SQL中集合操作的语义理解与性能意识第 54 题请介绍什么是内存泄漏,以及你在项目中如何定位和修复内存泄漏问题。 考察对内存泄漏概念的理解、排查思路与实战处理能力第 55 题Spark中间会一直生成小文件,如何处理? 考察对小文件问题的理解及处理策略第 56 题面对大数据量下的SQL查询性能问题,你会如何定位和优化? 考察性能问题定位方法与常见优化手段第 57 题给定Faster R-CNN网络和一堆数据,你会如何调参? 考察对目标检测模型Faster R-CNN调参的具体理解和实践第 58 题训练模型的时候 Loss 不下降怎么解决? 考察对模型训练中 Loss 停滞问题的排查与解决能力第 59 题HDFS小文件会造成什么问题? 考察对HDFS元数据模型和存储性能瓶颈的理解第 60 题SQL如何优化提升效率? 考察SQL查询优化的分析方法与常见手段