京东面试题 · Apache Spark
京东相关面试题,按最终去重题目聚合。
共 2550 道真题 · 当前筛选命中 21 道 · 更新 2026-08-05
筛选题目已选:Apache Spark
考察点
技术栈
第 1 题请对比 Spark 中 RDD 与 DataFrame 的区别,并说明各自适用的场景。 考察对 Spark 两大抽象的理解及其选型能力第 2 题在 Spark 中,你如何设置 executor 的 core 数量?为什么通常设置为 2? 考察对 Spark 资源分配与并行度权衡的理解第 3 题Spark和MapReduce的区别是什么?Spark为什么快? 考察对两种分布式计算框架架构差异的理解及性能优势的原理分析第 4 题请介绍你在实际项目中使用过哪些 Spark 调优参数,以及它们各自解决了什么问题。 考察对 Spark 常用调优参数的理解及实际应用场景的分析能力第 5 题执行一个PySpark作业,它的底层操作是怎么样的? 考察对PySpark执行模型、任务调度和底层计算原理的理解第 6 题请描述 Spark 任务从提交到执行的完整流程。 考察对 Spark 作业调度、执行模型和核心组件的理解第 7 题DataFrame和DataSet的区别 考察对Spark两种核心数据抽象的理解与适用场景辨析第 8 题spark.sql.shuffle.partitions调节的经验,调多大合适,是否有公式 考察对Spark shuffle分区设置原理、经验值与调优方法的理解第 9 题Spark和Hive的区别是什么? 考察对Spark与Hive在架构、计算模型和适用场景上的理解第 10 题在数据倾斜场景下,group by 操作如何进行优化? 考察对数据倾斜问题的识别能力及分布式聚合优化策略第 11 题Spark合并小文件怎么做的,落HDFS之前合并还是之后合并? 考察Spark写HDFS时小文件问题的处理策略与时机选择第 12 题什么是数据倾斜?如何解决? 考察对分布式计算中数据分布不均问题的理解及应对策略第 13 题Application、Job、Stage、Task在Spark中有什么区别? 考察Spark作业调度层级概念的理解第 14 题DataFrame和RDD有什么区别? 考察对Spark核心数据抽象的理解及适用场景第 15 题进一步讲解下Apache Spark中executor集群如何实现分布式一致。 考察对Spark执行引擎的深入理解,特别是executor间数据一致性机制第 16 题请比较 Spark 与其他主流大数据处理引擎(如 Hadoop MapReduce、Flink)在适用场景和性能上的优劣。 考察对 Spark 技术特点、适用场景及选型权衡的理解第 17 题在大数据处理中,数据倾斜是如何产生的,有哪些常见的解决思路? 考察对数据倾斜问题的识别、原因分析和解决策略第 18 题Spark有哪些算子,请举例说明。 考察对Spark核心算子及用途的掌握程度第 19 题请介绍 Spark 的 AQE(自适应查询执行)功能及其主要作用。 考察对 Spark 自适应查询执行机制的理解及应用场景第 20 题请介绍一下 AQE(自适应查询执行)的核心特性。 考察对 Spark AQE 核心特性的理解与适用场景