互联网/IT行业面试题 · 技术原理 · tech:apache-spark
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 92 道 · 更新 2026-08-05
筛选题目已选:技术原理 · tech:apache-spark
考察点
技术栈
第 41 题Spark stage怎么划分 考察Spark作业中stage划分的原理和宽度依赖理解第 42 题请介绍 Spark 的 TaskScheduler 调度算法。 考察对 Spark 任务调度原理的理解及对常用调度算法的掌握程度第 43 题请简述 Spark 的执行原理。 考察对 Spark 执行模型、任务调度与内存管理的理解第 44 题Spark怎么划分stage? 考察对Spark作业调度机制和宽窄依赖原理的理解第 45 题在 Spark 中求两数之和会用到哪些算子? 考察对 Spark 数据处理算子及并行计算模型的理解第 46 题请介绍 Spark 在 YARN 上的执行模型,包括 yarn-client 和 yarn-cluster 两种模式的区别。 考察对 Spark 部署模式与资源管理机制的理解第 47 题Spark 任务出现内存溢出(OOM)时,通常与哪些内存相关参数有关?请说明它们的作用。 考察对 Spark 内存管理与 OOM 相关参数的掌握第 48 题你知道Spark的宽窄依赖吗?有没有把宽依赖转化为窄依赖的例子? 考察对Spark任务依赖关系的理解及实际优化能力第 49 题在 Spark 中,哪些算子会触发宽依赖?请举例说明。 考察对 Spark 宽依赖算子及其数据 shuffle 机制的理解第 50 题Spark了解吗? 考察对Spark基础概念、核心组件和适用场景的理解第 51 题请说明在Spark作业中执行commit提交操作时需要配置的参数,并解释其作用。 考察对Spark内部提交机制及关键参数的理解第 52 题请说明 Spark 的作业调度机制,包括作业、阶段和任务的关系。 考察对 Spark 作业调度层级结构与执行流程的理解第 53 题有遇到大规模数据处理的情况吗?用过 Spark 吗? 考察大规模数据处理经验与 Spark 实际使用能力第 54 题请描述Spark应用通过jar包提交后,从提交命令到任务执行完成的完整过程。 考察对Spark任务提交、调度与执行生命周期的理解第 55 题Spark为什么快? 考察对Spark计算引擎核心优化机制的理解第 56 题Spark和MapReduce的区别 考察对两种大数据计算框架的架构原理和适用场景的理解第 57 题请介绍DWD层的设计理念和常见构建方式。 考察对数据仓库分层建模的理解及DWD层实践第 58 题在 Spark 中,广播变量(Broadcast Variable)的广播过程是怎样的? 考察 Spark 广播变量的内部机制、内存管理及适用场景第 59 题请解释 Spark 中的 semi join,它用于解决什么问题? 考察对 Spark SQL 语义及半连接(semi join)用途的理解第 60 题数据倾斜怎么排查,如何解决? 考察对分布式计算中数据倾斜问题的识别、定位与处理能力