宇信科技面试题 · Apache Spark
宇信科技相关面试题,按最终去重题目聚合。
共 219 道真题 · 当前筛选命中 6 道 · 更新 2026-08-05
筛选题目已选:Apache Spark
考察点
技术栈
第 1 题如何理解大数据任务的本质是“节点多则并行,节点少则串行,节点中等则整体并行加内部串行”这句话? 考察对大规模数据处理中并行化策略的理解和工程思维第 2 题Spark 有哪些常见的 Join 实现方式?请分别说明其适用场景。 考察对 Spark Join 类型及其适用场景的理解第 3 题大数据在分布式存储和计算层面的作用分别是什么?哪些技术比较有特点? 考察大数据技术栈的整体理解及分布式存储与计算的特性第 4 题Hive 查询为什么走 Spark 引擎通常比走 MR 更好?如果只能走 MR,可以从哪些方向优化? 考察对两种计算引擎差异的理解及 MR 场景下的优化能力第 5 题YARN在Hadoop生态中主要解决什么问题?什么是计算资源? 考察YARN资源调度的基本原理及对计算资源的理解第 6 题请介绍Spark的计算核心特性,比如它的计算模型和执行机制。 考察对Spark内存计算、RDD、DAG及执行流程的理解