在 DolphinScheduler 中,通常可以配置哪些类型的任务节点来执行不同的工作负载?
考察说明
考查对 DolphinScheduler 任务类型生态的熟悉程度。
回答思路
- 【回答框架 1】DolphinScheduler 作为工作流调度平台,内置了多种任务插件,常见任务类型包括 Shell、SQL、Python、Spark、Flink、MapReduce、HTTP、子流程、依赖、条件分支等。
- 【回答框架 2】Shell 任务用于执行任意 shell 命令或脚本,适合通用批处理;SQL 任务直接操作数据库执行查询或 DML,支持多种数据源;Python 任务运行 Python 脚本,便于数据处理和算法调用。
- 【回答框架 3】大数据类任务中,Spark 和 Flink 任务分别提交 Spark 应用和 Flink 作业,支持流批处理;MapReduce 任务用于提交 MR 作业;这些任务通常需要配置对应集群环境和资源参数。
- 【回答框架 4】HTTP 任务用于触发外部 API 接口,实现系统间联动;子流程任务允许嵌套调用其他工作流,实现复用;依赖任务控制任务间的依赖关系,条件分支任务根据上游结果动态选择执行路径。
- 【回答框架 5】此外还支持如数据质量检查、存储过程等扩展任务,具体类型随版本和插件安装情况有所差异,实际使用时以当前部署版本支持的任务列表为准。
- 【关键点 1】Shell、SQL、Python 是基础通用任务类型。
- 【关键点 2】Spark、Flink、MapReduce 覆盖大数据计算场景。
- 【关键点 3】HTTP、子流程、依赖、条件分支用于流程控制和系统集成。
- 【关键点 4】任务类型可通过插件机制扩展,不同版本支持范围可能不同。
- 【易错点 1】不要将任务类型与调度触发方式混淆,任务类型定义执行内容,调度方式定义何时触发。
- 【易错点 2】部分任务类型需要额外配置集群连接或依赖环境,不能仅凭类型名称假设可直接运行。