电商行业面试题 · 技术原理 · tech:apache-spark
电商行业相关面试题,按题目行业基础数据聚合。
共 10617 道真题 · 当前筛选命中 29 道 · 更新 2026-08-05
筛选题目已选:技术原理 · tech:apache-spark
考察点
技术栈
第 1 题请介绍 Spark 中内部表和外部表的区别。 考察对 Spark 表元数据与数据存储管理机制的理解第 2 题请介绍大数据治理的一般方法,并说明你熟悉的大数据组件及其核心原理。 考察大数据治理思路与核心技术组件的原理掌握第 3 题Application、Job、Stage、Task在Spark中有什么区别? 考察Spark作业调度层级概念的理解第 4 题Spark和MapReduce的区别是什么? 考察对Spark与MapReduce核心特性的理解与对比第 5 题请介绍Spark的三种join优化,以及针对数据倾斜的处理方法。 考察SparkSQL执行计划理解、join策略选择与数据倾斜调优能力第 6 题在大数据处理中,数据倾斜是如何产生的,有哪些常见的解决思路? 考察对数据倾斜问题的识别、原因分析和解决策略第 7 题请介绍 Spark 的 AQE(自适应查询执行)功能及其主要作用。 考察对 Spark 自适应查询执行机制的理解及应用场景第 8 题DataFrame和DataSet的区别 考察对Spark两种核心数据抽象的理解与适用场景辨析第 9 题spark.sql.shuffle.partitions调节的经验,调多大合适,是否有公式 考察对Spark shuffle分区设置原理、经验值与调优方法的理解第 10 题Presto和Spark的区别是什么? 考察对两种大数据计算引擎的架构、适用场景和性能特性的理解第 11 题请解释Spark中的宽依赖和窄依赖,并描述一个典型的DAG执行流程。 考察对Spark任务调度和依赖关系的理解第 12 题请分析数据倾斜的常见成因,并说明有哪些解决方案。 考察对分布式数据处理中数据倾斜问题的理解深度与解决能力第 13 题请对比 Spark 中 RDD 与 DataFrame 的区别,并说明各自适用的场景。 考察对 Spark 两大抽象的理解及其选型能力第 14 题Spark和MapReduce的区别是什么?Spark为什么快? 考察对两种分布式计算框架架构差异的理解及性能优势的原理分析第 15 题请介绍一下 AQE(自适应查询执行)的核心特性。 考察对 Spark AQE 核心特性的理解与适用场景第 16 题请比较 Spark 与其他主流大数据处理引擎(如 Hadoop MapReduce、Flink)在适用场景和性能上的优劣。 考察对 Spark 技术特点、适用场景及选型权衡的理解第 17 题在数据倾斜场景下,group by 操作如何进行优化? 考察对数据倾斜问题的识别能力及分布式聚合优化策略第 18 题什么是数据倾斜?如何解决? 考察对分布式计算中数据分布不均问题的理解及应对策略第 19 题Spark和Hive的区别是什么? 考察对Spark与Hive在架构、计算模型和适用场景上的理解第 20 题Spark和Hive对数据倾斜的处理有哪些异同? 考察对大数据引擎数据倾斜问题的理解与方案对比