后端岗位面试题 · tech:apache-spark
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 233 道 · 更新 2026-08-05
筛选题目已选:tech:apache-spark
考察点
技术栈
第 101 题MR和Spark的区别是什么? 考察对MapReduce与Spark核心架构、计算模型及适用场景差异的理解第 102 题请详细说明你当前所在公司日常进行数据统计时,主要采用哪些方式?这些方式分别适用于什么场景?例如针对实时数据统计、离线批量数据统计等不同需求,会选择不同的工具或方法吗? 考察数据统计方式与场景匹配能力第 103 题Flink 与 Spark 的容错机制和故障恢复机制有哪些异同? 考察对两种主流流批计算引擎容错设计的理解与对比第 104 题在数据倾斜场景下,group by 操作如何进行优化? 考察对数据倾斜问题的识别能力及分布式聚合优化策略第 105 题请介绍Spark的三种join优化,以及针对数据倾斜的处理方法。 考察SparkSQL执行计划理解、join策略选择与数据倾斜调优能力第 106 题Spark为什么比MR快? 考察对Spark和MapReduce执行引擎差异的理解及性能优化原理第 107 题请介绍 Spark 中 Shuffle 的过程及其涉及的主要组件。 考察对 Spark Shuffle 机制的理解,包括数据分区、磁盘读写和网络传输等核心环节第 108 题Spark如何进行数据倾斜的优化? 考察对Spark数据倾斜问题的识别、定位和常见优化手段的理解第 109 题请解释 Spark 中 Job 和 Stage 的概念及其关系。 考察对 Spark 作业分解与执行流程的理解第 110 题Spark是完全基于内存吗? 考察对Spark内存计算模型和存储层原理的理解第 111 题Spark合并小文件怎么做的,落HDFS之前合并还是之后合并? 考察Spark写HDFS时小文件问题的处理策略与时机选择第 112 题请比较 RDD 与 MapReduce 的优缺点。 考察对 RDD 与 MapReduce 在计算模型、性能与容错方面的理解第 113 题Spark常见的Shuffle策略有哪些?这些不同的策略分别在哪些项目中用到? 考察对Spark Shuffle机制的理解及其在不同业务场景下的应用第 114 题什么是 Spark 中的宽依赖和窄依赖?它们分别起到什么作用? 考察对 Spark 依赖关系原理及其对任务调度的影响第 115 题reduceByKey() 和 groupByKey() 的区别是什么? 考察对 Spark 算子执行语义和数据混洗性能的理解第 116 题请解释Spark Shuffle的原理及主要过程。 考察对Spark Shuffle机制、数据倾斜和性能影响的理解第 117 题Spark中的Task、Stage和Job之间是什么关系? 考察Spark执行模型的核心概念及其层次关系第 118 题Spark RDD和DataFrame的区别 考察对Spark核心数据抽象的理解及使用场景判断第 119 题讲一讲你对分布式数据处理框架(如 Hadoop、Spark 等)的理解。 考察对分布式数据处理框架核心概念、架构与适用场景的掌握第 120 题Spark调优中,代码层面有哪些手段? 考察对Spark应用代码级优化的理解与实践