后端岗位面试题 · tech:apache-spark

题库中标记为“后端”的结构化面试题。

89928 道真题 · 当前筛选命中 233 · 更新 2026-08-05

筛选题目已选:tech:apache-spark
第 161 题宽窄依赖,算子中哪个是宽依赖算子?哪个是窄依赖算子?简单举几个例子。 考察对宽窄依赖概念的理解及算子分类能力问题拆解技术原理Apache Spark第 162 题你知道Spark的宽窄依赖吗?有没有把宽依赖转化为窄依赖的例子? 考察对Spark任务依赖关系的理解及实际优化能力性能优化技术原理方案权衡Apache Spark第 163 题Application、Job、Stage、Task在Spark中有什么区别? 考察Spark作业调度层级概念的理解技术原理Apache Spark第 164 题请描述Spark应用通过jar包提交后,从提交命令到任务执行完成的完整过程。 考察对Spark任务提交、调度与执行生命周期的理解问题拆解技术原理Apache Spark第 165 题Spark和Hive对数据倾斜的处理有哪些异同? 考察对大数据引擎数据倾斜问题的理解与方案对比技术原理方案权衡问题排查Apache HiveApache Spark第 166 题Spark架构介绍一下,里面的进程? 考察Spark集群架构核心组件、进程职责与数据流转问题拆解技术原理Apache Spark第 167 题请解释一下 Map Join 的工作原理及其适用场景。 考察对分布式计算中优化手段的理解,特别是 Map Join 的执行机制与适用条件技术原理方案权衡Apache HiveApache Spark第 168 题DataFrame和RDD有什么区别? 考察对Spark核心数据抽象的理解及适用场景问题拆解技术原理技术选型Apache Spark第 169 题请介绍Spark中常见的4种Join优化方式,并说明各自适用的场景。 考察Spark Join优化原理及场景适配能力技术原理技术选型方案权衡Apache Spark第 170 题请解释 Spark 中 shuffle write 数据量的含义及其与 shuffle read 的关系。 考察对 Spark shuffle 写阶段机制与整体数据流理解性能优化技术原理Apache Spark第 171 题大数据生态圈都了解哪些? 考察大数据技术栈的广度和系统性理解系统设计技术原理Apache FlinkApache HadoopApache Hive第 172 题请介绍你使用 Spark 的经验,包括你处理过的典型数据处理任务以及你如何优化作业性能。 考察候选人 Spark 实际使用经验、问题拆解与性能优化能力性能优化项目复盘技术原理Apache Spark第 173 题请介绍Spark内存模型,说明各部分作用并给出调参思路。 考察对Spark统一内存管理机制的理解及参数调优能力性能优化技术原理Apache Spark第 174 题Hive on Spark和Hive原生的区别 考察对Hive执行引擎选择与性能特性的理解技术原理技术选型Apache HiveApache SparkMapReduce第 175 题进一步讲解下Apache Spark中executor集群如何实现分布式一致。 考察对Spark执行引擎的深入理解,特别是executor间数据一致性机制风险判断技术原理Apache Spark第 176 题处理小文件有哪些方法?请举例说明。 考察对大数据场景下小文件问题的理解及解决方案的掌握技术原理技术选型方案权衡Apache FlinkApache HudiApache Spark第 177 题请谈谈你对大数据技术的了解。 考察大数据基础知识的广度与理解深度业务理解技术原理Apache FlinkApache SparkHDFS第 178 题请比较 Spark 与其他主流大数据处理引擎(如 Hadoop MapReduce、Flink)在适用场景和性能上的优劣。 考察对 Spark 技术特点、适用场景及选型权衡的理解技术原理技术选型方案权衡Apache Spark第 179 题请列举 Hive 或 Spark 日常调优中你常用的关键参数,并说明其作用。 考察对 Hive/Spark 性能调优核心参数的理解与实际应用能力性能优化技术原理Apache HiveApache Spark第 180 题以 Spark 为例,如何确定 core 和内存等资源参数的合适值? 考察对 Spark 资源调优原理和计算方法的理解性能优化问题拆解技术选型Apache Spark