后端岗位面试题 · 方案权衡 · tech:apache-flink
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 41 道 · 更新 2026-08-05
筛选题目已选:方案权衡 · tech:apache-flink
考察点
技术栈
第 1 题在 Flink 中,如何处理热点数据导致的负载不均问题? 考察对 Flink 数据倾斜问题的识别、定位与解决能力第 2 题Flink 中过滤规则是如何定义与执行的? 考察对过滤规则实现方式的理解第 3 题对于一个流式pipeline的场景,很多个目标源,每个目标源有很多个指标,指标需要做实时计算,计算时间很久,你会怎么设计? 考察流式实时计算架构设计能力,重点在于处理计算耗时与实时性矛盾第 4 题如何确保实时任务数据不重复、不丢失? 考察实时数据处理的精确一次(Exactly-Once)和数据一致性保障能力第 5 题在已有流式下载方案的基础上,如何评估引入 Flink 做数据下载导出的必要性与实现思路? 考察对流式处理框架的适用边界、方案权衡和技术选型判断第 6 题请介绍 Flink 的状态过期策略(State TTL)及其实现原理。 考察对 Flink 状态管理和状态过期机制的理解第 7 题设计一个支持10万路视频流的系统,并用算法解析视频流,请说明系统设计思路。 考察大规模视频流处理系统的架构设计、算法落地与资源权衡第 8 题请解释一下Flink的Checkpoint和Savepoint分别是什么,并说明它们的主要区别。 考察对Flink状态管理机制的理解及两者差异的把握第 9 题请说明你对 Flink CDC 的理解。 考察 Flink CDC 的原理、应用场景与关键机制第 10 题实时数仓如何保证指标实时且数据准确? 考察实时计算正确性与端到端一致性设计第 11 题在配置大数据计算引擎(如 Spark 或 Flink)的内存管理时,是否应将最大堆与最小堆参数设置为相同值?请说明原因。 考察对 JVM 堆内存动态调整机制及其在分布式计算环境中影响的理解第 12 题请介绍 Flink 中时间窗口的概念、类型及其适用场景。 考察对 Flink 时间窗口(滚动、滑动、会话)及事件时间/处理时间语义的理解第 13 题Flink是如何保证数据不丢失和不重复处理的? 考察Flink端到端一致性保障机制的掌握程度第 14 题请设计一个方案,将海量数据接入业务后台,并进行处理和存储。你会如何设计实现? 考察对海量数据接入、处理和存储的整体架构设计与关键技术选型第 15 题请介绍 Flink 中双流 Join 的实现方式、适用场景与常见问题。 考察 Flink 双流 Join 的机制理解、方案选型与工程实践第 16 题你在使用 Flink 时是用 SQL 方式开发,还是用 DataStream API 或 Table API?请说明选择原因。 考察对 Flink 不同开发方式的掌握与选型能力第 17 题实时指标计算中,你通常使用哪种时间记录方式?如果针对同一份埋点日志需要支持多种时间维度(如秒、分钟、小时)的统计分析,你会如何设计埋点表结构和实现方案? 考察实时指标的时间建模、埋点表设计及多维度聚合能力第 18 题现在有个场景,如何实时的知道搜狐视频每个视频的点赞收藏在这一时刻是top前5,能实时展示,给算法团队做推送? 考察实时流处理、滑动窗口统计与TopN计算的架构设计能力第 19 题Spark Streaming和Flink的区别是什么? 考察对两种主流流处理引擎架构与语义的差异理解第 20 题Flink和Spark Streaming的区别是什么? 考察对两种主流流处理框架的核心模型、时效性、容错机制和适用场景的理解