哔哩哔哩面试题 · 技术原理 · Apache Spark
哔哩哔哩相关面试题,按最终去重题目聚合。
共 2456 道真题 · 当前筛选命中 20 道 · 更新 2026-08-05
筛选题目已选:技术原理 · Apache Spark
考察点
技术栈
第 1 题请谈谈你对Spark和MapReduce的理解,并说明它们各自的适用场景。 考察对分布式计算框架的技术原理掌握与方案选型能力第 2 题请介绍Spark中shuffle的几种实现方式,并简要说明sort-based shuffle的特点。 考察对Spark shuffle机制及其演进的理解第 3 题Spark 的 count distinct 是怎么做的? 考察对 Spark 分布式去重计数底层实现的理解第 4 题请简要介绍 Spark 中的 coalesce 算子及其作用场景。 考察对 Spark 分区调整算子的理解与实际应用第 5 题请解释 Spark 中 local read 数据量的含义及其在任务执行中的影响。 考察对 Spark 任务读取本地数据的理解及对性能的影响第 6 题Spark UI 怎么看,关注哪些点去判断数据倾斜? 考察对 Spark UI 的理解、数据倾斜的症状识别与排查路径第 7 题Spark常见的Shuffle策略有哪些?这些不同的策略分别在哪些项目中用到? 考察对Spark Shuffle机制的理解及其在不同业务场景下的应用第 8 题请介绍你最熟悉的大数据框架 Spark,包括它的核心架构、常用组件及其应用场景。 考察对 Spark 架构理解、组件掌握及实际应用能力第 9 题请描述MapReduce或Spark中常见的Shuffle流程,并说明其关键环节。 考察对分布式计算框架中Shuffle机制的理解第 10 题请谈谈你对大数据生态中常用组件的了解,比如存储、计算或查询框架。 考察大数据技术栈的广度、深度及与实际项目的结合能力第 11 题在排查 Spark 数据倾斜时,你通常关注 Spark UI 中的哪些指标或参数?请具体说明。 考察对 Spark 数据倾斜排查中 UI 指标与参数的理解第 12 题在 Spark 中执行 join 时,如果两个表一大一小,如何实现高效 join? 考察对大表小表 join 优化策略的掌握程度第 13 题宽窄依赖,算子中哪个是宽依赖算子?哪个是窄依赖算子?简单举几个例子。 考察对宽窄依赖概念的理解及算子分类能力第 14 题请解释 Spark 中 shuffle write 数据量的含义及其与 shuffle read 的关系。 考察对 Spark shuffle 写阶段机制与整体数据流理解第 15 题大数据生态圈都了解哪些? 考察大数据技术栈的广度和系统性理解第 16 题请列举 Hive 或 Spark 日常调优中你常用的关键参数,并说明其作用。 考察对 Hive/Spark 性能调优核心参数的理解与实际应用能力第 17 题请介绍你了解哪些常用的大数据基础组件,并说明各自的作用。 考察大数据技术栈的广度与对组件职责的理解第 18 题请解释 Spark 中 shuffle read 数据量的含义及其对作业性能的影响。 考察对 Spark shuffle 阶段数据读取机制的理解第 19 题请谈谈你对大数据相关技术的了解,包括你熟悉的大数据组件或框架。 考察候选人对大数据技术的知识储备和实际使用经验第 20 题SparkSQL 做 Join 的时候有哪些 Join 算法? 考察对 Spark 各 Join 算法原理、适用场景和参数选择的掌握