电商行业面试题 · 技术原理 · tech:apache-spark

电商行业相关面试题,按题目行业基础数据聚合。

10617 道真题 · 当前筛选命中 29 · 更新 2026-08-05

筛选题目已选:技术原理 · tech:apache-spark
第 1 题请介绍 Spark 中内部表和外部表的区别。 考察对 Spark 表元数据与数据存储管理机制的理解技术原理方案权衡Apache Spark第 2 题请介绍大数据治理的一般方法,并说明你熟悉的大数据组件及其核心原理。 考察大数据治理思路与核心技术组件的原理掌握问题拆解技术原理技术选型Apache FlinkApache SparkHDFS第 3 题Application、Job、Stage、Task在Spark中有什么区别? 考察Spark作业调度层级概念的理解技术原理Apache Spark第 4 题Spark和MapReduce的区别是什么? 考察对Spark与MapReduce核心特性的理解与对比技术原理技术选型Apache SparkMapReduce第 5 题请介绍Spark的三种join优化,以及针对数据倾斜的处理方法。 考察SparkSQL执行计划理解、join策略选择与数据倾斜调优能力性能优化技术原理方案权衡Apache Spark第 6 题在大数据处理中,数据倾斜是如何产生的,有哪些常见的解决思路? 考察对数据倾斜问题的识别、原因分析和解决策略问题拆解技术原理方案权衡Apache HiveApache Spark第 7 题请介绍 Spark 的 AQE(自适应查询执行)功能及其主要作用。 考察对 Spark 自适应查询执行机制的理解及应用场景性能优化技术原理Apache Spark第 8 题DataFrame和DataSet的区别 考察对Spark两种核心数据抽象的理解与适用场景辨析技术原理技术选型Apache Spark第 9 题spark.sql.shuffle.partitions调节的经验,调多大合适,是否有公式 考察对Spark shuffle分区设置原理、经验值与调优方法的理解性能优化技术原理方案权衡Apache Spark第 10 题Presto和Spark的区别是什么? 考察对两种大数据计算引擎的架构、适用场景和性能特性的理解技术原理技术选型方案权衡Apache SparkPresto第 11 题请解释Spark中的宽依赖和窄依赖,并描述一个典型的DAG执行流程。 考察对Spark任务调度和依赖关系的理解问题拆解技术原理Apache Spark第 12 题请分析数据倾斜的常见成因,并说明有哪些解决方案。 考察对分布式数据处理中数据倾斜问题的理解深度与解决能力技术原理方案权衡问题排查Apache FlinkApache HiveApache Spark第 13 题请对比 Spark 中 RDD 与 DataFrame 的区别,并说明各自适用的场景。 考察对 Spark 两大抽象的理解及其选型能力技术原理技术选型Apache Spark第 14 题Spark和MapReduce的区别是什么?Spark为什么快? 考察对两种分布式计算框架架构差异的理解及性能优势的原理分析技术原理技术选型方案权衡Apache SparkMapReduce第 15 题请介绍一下 AQE(自适应查询执行)的核心特性。 考察对 Spark AQE 核心特性的理解与适用场景性能优化技术原理方案权衡Apache Spark第 16 题请比较 Spark 与其他主流大数据处理引擎(如 Hadoop MapReduce、Flink)在适用场景和性能上的优劣。 考察对 Spark 技术特点、适用场景及选型权衡的理解技术原理技术选型方案权衡Apache Spark第 17 题在数据倾斜场景下,group by 操作如何进行优化? 考察对数据倾斜问题的识别能力及分布式聚合优化策略性能优化技术原理问题排查Apache Spark第 18 题什么是数据倾斜?如何解决? 考察对分布式计算中数据分布不均问题的理解及应对策略技术原理方案权衡问题排查Apache HiveApache Spark第 19 题Spark和Hive的区别是什么? 考察对Spark与Hive在架构、计算模型和适用场景上的理解技术原理Apache HiveApache Spark第 20 题Spark和Hive对数据倾斜的处理有哪些异同? 考察对大数据引擎数据倾斜问题的理解与方案对比技术原理方案权衡问题排查Apache HiveApache Spark