Advertisement

海豚调度,dolphinscheduler-data-quality-dev-SNAPSHOT

  • 5星
  •     浏览量: 0
  •     大小:None
  •      文件类型:JAR


简介:
dolphin-scheduler 是一个高效的调度工具,支持多种数据源和数据库后端。其版本控制文件中包含以下关键信息: confcommon.properties 其中: data-quality.jar.name = dolphin-scheduler_data_quality_dev_snapshot-jar 请注意配置细节: - 如果单独打包 data-quality 的话,请确保修改包名,并使 data-quality.jar.name 与之保持一致。 - 在进行部署之前,务必执行 SQL 更新脚本以初始化数据库。建议在使用 MySQL 数据源时,考虑注释掉 pom.xml 中的 hiveScope 注释项(hiveScope)。 - 当前版本已通过测试支持 MySQL、PostgreSQL 和 Hive 数据源。对于其他数据源,请谨慎处理并及时反馈结果。 - 在配置 Spark 时,确保其能够正确读取 Hive 元数据,并避免使用 jdbc 方式访问 Hive 表。 这些设置将有助于您顺利运行和扩展 DolphinScheduler 应用。

全部评论 (0)

还没有任何评论哟~
客服
客服
  • DolphinScheduler
    优质
    DolphinScheduler是一款功能强大的工作流调度平台,因其流畅灵活的特点,被形象地比喻为“海豚”,寓意其在数据处理领域中如同海洋中的海豚一样灵动自如。 DolphinScheduler结合海豚组件使用可以提供更强大的数据处理能力和用户体验。 DolphinScheduler是一个分布式的易扩展的工作流任务调度平台,支持包括SQL、Spark、Flink等在内的多种类型的任务执行;而“海豚”则是对该项目的一个形象化称呼或代号,在此环境中它可能指代某个特定的功能模块或者增强特性。通过两者结合可以更好地满足大数据环境下的复杂业务需求和项目管理要求。
  • DolphinScheduler 器的动态任务执行参数传递
    优质
    本篇介绍如何在 DolphinScheduler 中灵活地为动态任务分配执行参数,通过配置和使用方法详解,帮助用户实现高效的任务自动化与管理。 ### DolphinScheduler 海豚调度器动态传递任务执行参数 #### 一、重要性及应用场景 **DolphinScheduler(简称DS)** 是一款强大的分布式任务调度平台,支持多种类型的作业执行,如Shell、Python、Spark等。它能够高效地管理任务间的依赖关系,并提供了丰富的功能来满足企业级的数据处理需求。在大数据领域,特别是对于需要频繁执行批处理任务的场景来说,动态传参的功能显得尤为重要。 #### 二、动态传参的核心价值 动态传参是DS的一项关键特性,它允许用户在任务流中灵活地传递变量值,这对于批量补采数据或自动化执行一系列作业非常有用。例如,在需要对不同日期的数据进行处理时,可以通过设置一个全局参数来控制所有任务中的日期变量,而无需逐个修改每个任务节点的配置。 #### 三、使用方法详解 ##### 1. **基本概念** - **自定义OUT参数**:这是实现动态传参的基础。通过在任务节点中定义一个OUT参数,可以将其作为输出传递给下一个任务节点。 - `${setValue(key=$value)}`:这个命令用于设置自定义OUT参数的值,其中`key`表示参数名,`$value`表示参数值。 - `${value}`:用于在下游任务中引用前一任务传递过来的参数值。 ##### 2. **操作步骤** - **步骤1**:在第一个任务节点中定义并设置OUT参数。例如,在任务节点111中,我们定义了一个名为`date_str1`的OUT参数,并将其设置为当前日期的前一天。 ```bash data_str=`date -d 0 days ago +%Y%m%d` echo ${setValue(date_str1=$data_str)} ``` - **步骤2**:在下游任务节点中接收并使用这些参数。例如,在任务节点222中,我们首先打印出从上游节点传递过来的`date_str1`参数值,然后再将其设置为新的OUT参数`date_str2`。 ```bash echo ${date_str1} date_str=${date_str1} echo ${setValue(date_str2=$date_str)} ``` - **步骤3**:继续在后续任务节点中传递或使用参数。例如,在任务节点333中,我们可以直接打印出从任务节点222传递过来的`date_str2`参数值。 ```bash echo ${date_str2} ``` ##### 3. **注意事项** - 当需要向下一级传递动态参数时才使用自定义OUT参数,否则不需要。 - 设置的传递变量参数在所有需要调用的任务节点中必须唯一,避免混淆。 #### 四、实战案例 为了更好地理解动态传参的实现过程,下面提供了一个完整的示例: 1. **任务节点111** - **脚本内容**: ```bash data_str=`date -d 0 days ago +%Y%m%d` echo ${setValue(date_str1=$data_str)} ``` - **自定义参数**:`date_str1OUTVARCHAR` 2. **任务节点222** - **脚本内容**: ```bash echo ${date_str1} date_str=${date_str1} echo ${setValue(date_str2=$date_str)} ``` - **自定义参数**:`date_str2OUTVARCHAR` 3. **任务节点333** - **脚本内容**: ```bash echo ${date_str2} ``` #### 五、总结 通过上述示例可以看出,DolphinScheduler的动态传参功能极大地方便了批量数据处理任务的自动化执行,减少了人工干预的需求。对于需要频繁进行补采数据的场景来说,这一特性无疑是一个极大的生产力提升工具。开发者只需在任务流的入口处设置好参数,即可轻松实现参数在整个流程中的传递,极大地简化了开发与运维的工作流程。
  • Quality of Service Data Set for Services
    优质
    本数据集提供了多种服务的质量数据,涵盖响应时间、可用性和性能指标,旨在支持服务质量的研究与分析。 在科研论文的实验部分可以使用2507个service的QoS数据进行整合。
  • DolphinScheduler 任务系统 v1.3.3
    优质
    DolphinScheduler是一款功能强大的分布式任务调度平台,v1.3.3版本提供了可视化的任务管理、可靠的执行控制及丰富的监控报警功能。 DolphinScheduler 是一个大数据分布式工作流任务调度系统(原名EasyScheduler),由 Apache 育成项目支持。该系统旨在解决在大数据研发过程中遇到的ETL处理依赖关系复杂、无法直观监控任务健康状态等问题。通过使用 DAG 流式方式,DolphinScheduler 可以将 Task 组装起来,并实时监控其运行状态。此外,它还提供了重试、从指定节点恢复失败的任务以及暂停和终止任务等操作的支持。
  • 洋中的社交网络
    优质
    海洋中的社交高手——海豚,以复杂而精密的社会结构著称。它们通过独特的声波交流,在广阔的海域中建立起错综复杂的“朋友圈”,展现了非凡的智慧与情感深度。 在信息技术领域特别是数据分析、图论以及社交网络分析方面,“社区检测”是一个重要的研究主题。它是指在网络结构中识别具有紧密内部联系而与其他部分相对隔离的子群体的过程,广泛应用于包括社交网络、生物网络、互联网及交通网络等多样化场景之中,帮助我们理解复杂网络的构成和动态,并预测行为模式。“海豚社会网络”是社区检测的一个经典案例,源自生物学研究领域。该数据集基于对一群海豚长期观察所得的数据构建而成,记录了它们之间的互动频率并形成一个加权图模型,在这个模型中节点代表每一只海豚,边的权重则表示两头海豚之间互动的程度。 通过运用社区检测算法可以将这些海豚划分为不同的“社群”,每个社群内的成员往往有着更频繁且紧密的关系。常见的社区检测方法包括: 1. **模块度最大化**:这是最常用的方法之一,旨在优化网络中的模块化程度(一种衡量子群体间连接强度的指标)。 2. **谱聚类法**:利用图拉普拉斯矩阵进行分类以识别出具有高度连通性的子群落。 3. **标签传播算法(LPA)**:每个节点依据其邻居的标签更新自己的状态直至达到稳定,从而形成社群结构。 4. **Blondel Louvain 方法**:通过迭代地将节点分配至最合适的社区来提升全局模块化度数直到无法进一步提高为止。 5. “Clauset-Newman-Moore”算法(快速贪婪聚类):通过合并能够带来最大模体增益的节点对逐步构建社群结构。 海豚社会网络数据集因其实用性和代表性,经常被用来测试和对比不同社区检测方法的效果。通过对这些社群进行分析研究者可以了解有关海豚的行为模式、社交习惯以及可能的社会组织形式等信息,在实际应用中,除了生物学领域之外,“社区检测”技术同样适用于社交媒体平台上的用户群体识别;在推荐系统方面帮助发现用户的兴趣小组以提高个性化推荐的精度;在网络安全层面则有助于辨识潜在威胁集群从而加强防护能力。总体而言,“海豚社会网络”数据集为深入研究复杂网络结构与动态提供了宝贵的资源,是社区检测领域不可或缺的一部分。
  • DolphinScheduler 工作流引擎详解.pdf
    优质
    本PDF详细解析了DolphinScheduler工作流调度引擎的各项功能与应用场景,适合对大数据任务自动化管理感兴趣的读者。 Apache DolphinScheduler是一个分布式去中心化且易于扩展的可视化DAG工作流任务调度系统。它旨在解决数据处理流程中的复杂依赖关系问题,并使调度系统能够直接应用于实际的数据处理场景中,实现“开箱即用”。 原名为EasyScheduler的DolphinScheduler由易观开发,在2019年8月29日通过全票投票决议正式成为Apache孵化器项目。由于名称在国外已被其他应用使用,社区讨论后决定将其更名为DolphinScheduler(简称DS)。海豚聪明、人性化且能够左右脑互相换班终生不眠的特性启发了这个名字的选择,希望DolphinScheduler也能像它的名字一样灵活易用。 ### Apache DolphinScheduler (DS) 工作流调度引擎知识点概览 #### 一、Apache DolphinScheduler简介 **Apache DolphinScheduler**(简称 DS)是一个分布式、去中心化且易于扩展的可视化 DAG 工作流任务调度系统。它主要针对大数据处理流程中的复杂依赖关系提供解决方案,使得调度系统能够直接应用于数据处理流程中,实现“开箱即用”。 - **发展历程** - 曾用名为 EasyScheduler,由易观开发。 - 2019年8月29日正式成为Apache孵化器项目。 - 因名称在国外已被其他应用使用,社区投票决定更名为DolphinScheduler。 - **命名含义** - 名称灵感来源于海豚,寓意聪明、人性化且能够左右脑互相换班终生不眠的特性。 - 希望DS能够像其名字一样灵活易用。 #### 二、DolphinScheduler核心特性 - **DAG图表示法**: - 使用 DAG 图的形式将任务按照依赖关系进行关联,便于直观展示任务间的逻辑关系。 - 支持实时可视化监控任务执行状态。 - **丰富的任务类型支持** - 包括 Shell、MapReduce、Spark、SQL(MySQL、PostgreSQL、Hive、SparkSQL)、Python 和 Sub_Process 等多种类型的作业。 - 在1.2.0版本中新增了对 Flink和HTTP 类型的支持。 - **多样化的调度模式**: - 支持定时调度、依赖调度以及手动调度等不同方式。 - 提供暂停/停止/恢复任务的功能,支持失败重试及告警机制,并允许从指定节点重新启动失败的任务。 - **任务管理与监控** - 允许设置工作流和作业的优先级,提供故障转移和超时警告等功能。 - 支持全局参数配置以及自定义节点参数设定。 - 可以在线上传、下载并管理资源文件。 - **集群管理和高可用性(HA)**: - 实现了集群 HA,并使用 Zookeeper 来实现 Master 和 Worker 集群的去中心化。 - 支持查看Master/Worker 的 CPU 负载和内存使用情况等信息。 - **可视化展示** - 可以通过树形或甘特图形式显示工作流运行历史,提供任务状态统计、流程状态统计等功能。 - **其他高级功能**: - 包括补数操作增强灵活性。 - 支持多租户部署和国际化配置等特性。 #### 三、谁在使用DolphinScheduler - **用户群体** - 大数据处理团队,包括但不限于数据工程师与分析师。 #### 四、DolphinScheduler架构设计 - 去中心化的设计提高了系统的稳定性和扩展性。 - 支持多种存储和计算引擎的集成。 通过以上介绍可以看出,**Apache DolphinScheduler**不仅具备强大的任务调度能力,并提供了丰富的特性和功能以满足大数据处理流程中的各种需求。无论是对于初学者还是经验丰富的数据工程师来说,DS都是一个值得深入了解和使用的强大工具。
  • DolphinScheduler任务系统——其他分类
    优质
    DolphinScheduler是一款功能强大的分布式工作流任务调度平台,适用于企业级数据处理和业务流程自动化。它支持复杂的依赖关系、丰富的插件机制及灵活的任务管理界面,帮助企业高效运行各类批处理作业,提升运营效率与服务质量。 Apache DolphinScheduler(原名EasyScheduler)是一个大数据分布式工作流任务调度系统,旨在解决在大数据开发过程中ETL处理复杂的依赖关系,并且不能实时监控任务健康状态的问题。DolphinScheduler采用DAG图的方式将Task组织起来,能够实时监控任务运行状况,并支持重试、从指定节点恢复失败的任务、暂停及终止操作等功能。 该系统的特性包括: 1. 以分布式和易扩展的可视化方式呈现DAG工作流。 2. 支持多种类型的任务:Shell脚本、MR(MapReduce)、Spark作业、SQL(MySQL, PostgreSQL, Hive, Spark SQL),Python脚本,子进程等。 3. 提供定时调度、依赖关系触发调度、手动启动/停止任务以及失败重试和告警功能。还支持从指定节点恢复故障及终止运行的任务等功能。 4. 支持为工作流设置优先级,并可以处理任务的故障转移及超时告警等问题。 5. 允许设定全局参数与特定节点上的自定义参数。 6. 提供资源文件上传、下载和管理功能,包括在线创建和编辑等操作。 7. 使用户能够在线查看并滚动日志以及下载日志内容。 8. 实现了集群的高可用性配置,通过Zookeeper实现主从服务器与工作节点之间的去中心化架构。 9. 可以实时监控MasterWorker CPU负载、内存使用情况和CPU状态等信息。 10. 提供甘特图展示历史运行数据,并支持任务及流程的状态统计功能。 11. 支持补数操作,确保数据完整性。 12. 实现多租户环境下的资源隔离与管理机制。 13. 系统具备国际化语言的支持能力。 此外,DolphinScheduler还有许多其他特性等待开发者们进一步探索。
  • Download Designing Data-Intensive Applications in English (High-Quality Complete Version)
    优质
    《Designing Data-Intensive Applications》英文版全面介绍了数据系统的设计原则和实践,涵盖数据模型、存储、检索等多个方面,适合软件架构师和技术管理者阅读。 请复制该连接:https://pan.baidu.com/s/1slqjTDF ,下载.txt文档后,在文档中可以找到密码,直接粘贴即可进行下载,感谢支持。