电商行业面试题 · 性能优化 · Apache Spark
电商行业相关面试题,按题目行业基础数据聚合。
共 10617 道真题 · 当前筛选命中 7 道 · 更新 2026-08-05
筛选题目已选:性能优化 · Apache Spark
考察点
技术栈
第 1 题请介绍Spark的三种join优化,以及针对数据倾斜的处理方法。 考察SparkSQL执行计划理解、join策略选择与数据倾斜调优能力第 2 题请介绍 Spark 的 AQE(自适应查询执行)功能及其主要作用。 考察对 Spark 自适应查询执行机制的理解及应用场景第 3 题spark.sql.shuffle.partitions调节的经验,调多大合适,是否有公式 考察对Spark shuffle分区设置原理、经验值与调优方法的理解第 4 题请介绍一下 AQE(自适应查询执行)的核心特性。 考察对 Spark AQE 核心特性的理解与适用场景第 5 题在数据倾斜场景下,group by 操作如何进行优化? 考察对数据倾斜问题的识别能力及分布式聚合优化策略第 6 题执行一个PySpark作业,它的底层操作是怎么样的? 考察对PySpark执行模型、任务调度和底层计算原理的理解第 7 题Spark合并小文件怎么做的,落HDFS之前合并还是之后合并? 考察Spark写HDFS时小文件问题的处理策略与时机选择