
DolphinScheduler 快速指南5 分钟部署跑通第一个 DAG 调度工作流【免费下载链接】dolphinschedulerApache DolphinScheduler is the modern data orchestration platform. Agile to create high performance workflow with low-code项目地址: https://gitcode.com/GitHub_Trending/dol/dolphinschedulerDolphinScheduler 是一个开源的分布式可视化 DAG 工作流任务调度系统专门处理数据流程里“先跑谁、后跑谁、失败了怎么接着跑”的问题。如果你有一批需要定时执行的脚本或 ETL 流程目前靠 crontab 加人工盯进度它值得花一个小时体验一下。本文把部署方式和一次完整的使用过程走一遍。第一次接触部署 standalone 镜像登录默认控制台官方提供 Standalone、Cluster、Docker、Kubernetes 四种部署方式初次体验选 standalone-server 镜像最快单个容器包含全部核心服务元数据用内存 H2 库存储没有外部依赖。docker run --name dolphinscheduler -p 12345:12345 -p 25333:25333 -d \ apache/dolphinscheduler-standalone-server:latest启动后在浏览器打开http://localhost:12345/dolphinscheduler/ui用默认账号admin、密码dolphinscheduler123登录就进入控制台首页。镜像 tag 可换成你需要的稳定版本。用 docker-compose 启动全部服务如果希望 api、master、worker、alert 各自独立容器且元数据持久化到 PostgreSQL就用源码包里的deploy/docker/目录配合 docker-compose 启动首次加schemaprofile 初始化数据库结构再用allprofile 拉起全部服务。docker-compose --profile schema up -d docker-compose --profile all up -d细节见 Docker 部署文档其中也说明了如何复用已有的 PostgreSQL 和 ZooKeeper。它能帮你解决什么把任务依赖关系变成可视化编排crontab 的麻烦在于任务之间的依赖只能靠执行时间和代码注释表达。DolphinScheduler 把依赖关系直接画在 DAG 画布上先后、并行、分支都通过节点连线表达。以每日 ETL 为例“抽取 → 清洗 → 入库 → 通知”串成一条工作流中间某步失败后可以从该步重跑不必整条重来。数据源与任务类型集中管理数据源管理页统一配置 MySQL、PostgreSQL、Hive 等库的连接信息保存前可测试连通性SQL、DataX 等需要查库的任务直接按名称引用数据源账号密码不必散落在各个脚本里。任务侧任务插件目录 内置了 Shell、SQL、Spark、Flink、DataX、HTTP 等几十种任务实现覆盖抽取、转换、加载各环节。调度失败告警与集群监控Monitor 页面实时展示各 master、worker 节点的 CPU、内存、心跳状态告警通道支持钉钉、企业微信、飞书、邮件等。配合任务的失败重试次数配置任务失败时会主动推送消息省掉大量“任务跑完没”的人工确认工作。跟它走一遍下面以一条“业务库 → Hive”的同步流程为例完整走一遍大约 10 分钟。1. 创建项目。DolphinScheduler 里所有工作流都必须属于一个项目先在项目管理页建一个。2. 创建工作流并拖入任务。进入项目的“工作流定义”页点击创建工作流从左侧任务类型列表把节点拖到画布上。我建了 4 个节点Shell 任务先检查上游业务库的增量文件是否就绪DataX 任务从业务库抽取数据SQL 任务完成清洗并写入 Hive最后用 HTTP 任务发送完成通知。3. 连依赖、上线。用箭头按顺序连接任务表达先后依赖保存后点“上线”。注意工作流只有上线后才能运行和被定时调度。4. 运行并查看日志。点击运行后进入“工作流实例”页查看各节点执行状态对任务节点右键可以打开该任务的执行日志失败时能直接定位到出错的一行。5. 看监控面板。任务运行期间打开 Monitor 的 Worker 页确认 CPU、内存、线程池占用在预期范围内判断机器资源是否扛得住这批任务。上手后的注意点standalone 镜像只适合体验元数据在内存数据库里重启即清空正式使用请用 docker-compose 或集群部署。插件依赖需单独下载3.3.0 起二进制包不再自带任务插件依赖遇到ClassNotFoundException时运行发行包里的install-plugins.sh下载或在conf/plugins_config里指定只装需要的插件。运行任务前先给用户分配租户租户对应 worker 实际执行任务的 Linux 用户未分配时走默认租户多用户环境下容易出任务目录权限问题。补数有原生入口Web UI 支持按历史时间范围重跑工作流不用为回补数据临时写脚本。写在最后除 Web UI 外DolphinScheduler 还支持通过 Open API 和 Python SDK 创建工作流便于纳入现有的自动化流水线。生产部署前建议先读一遍 快速上手教程 和仓库内的 Kubernetes 部署模板。如果团队里有周期性调度的需求不妨先部署一个实例把一条现有的 crontab 流程搬过来试试。【免费下载链接】dolphinschedulerApache DolphinScheduler is the modern data orchestration platform. Agile to create high performance workflow with low-code项目地址: https://gitcode.com/GitHub_Trending/dol/dolphinscheduler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考