当前位置:首页 > 报告详情

2020Flink峰会报告:6- Flink SQL-TSY.pdf

上传人: li 编号:29337 2020-12-01 39页 9.35MB

1、数据接入数据接入 #2 数仓数仓与数据集成与数据集成 #1 数据入仓湖数据入仓湖 #3 数据打宽数据打宽 ( Joins )( Joins ) #4 总结总结 #5 #1 数仓与数据集成 数据仓库 与 数据集成 数据仓库是一个集成的(Integrated),面向主题的(Subject-Oriented),随时 间变化的(Time-Variant),不可修改的(Nonvolatile)数据集合,用于支持管 理决策。 数据仓库之父 Bill Inmon 于1990年提出 数据仓库的首要目的:数据集成,将多个分散的、异构的数据源整合在一起,便于 后续分析。 数据集成 与 ETL 数据集成的主要步骤:

2、 数据接入(Extract) 数据清洗、打宽 (Transformation) 数据入仓、入湖 (Load) E T L 传统数据仓库 主要的问题: 实时、离线数仓两套割裂的链路,造成重复工作,重复资源消耗 实时、离线底层数据模型不一致,数据一致性和质量难以保障 ETL 数据集成 Hive HDFS KafkaKafka ODS ODS DWD DWD 业务数据库 业务日志 实时数仓 离线数仓 业务数据库 业务日志 Binlog 采集 定时 Query Flume DIM DIM Hive 打宽 打宽 DWS Kafka 服务层 (OLAP/KV/RDS) Hive DWS 服务层 (OLAP

3、/KV/RDS) Flume Sqoop Canal Hive DB Flink Hive MR 流批一体的 ETL 数据集成 核心区别: Flink 原生支持 CDC,接入数据库数据更方便 强大灵活的维表关联能力,满足不同工作负载和时效性需求 实时层做数据接入和数据转换,离线数仓通过实时明细层回流 Flink 流式写入 Hive,自动合并小文件 优势: 统一基础公共数据,保障一致性 提升离线数仓时效性 减少组件和链路的维护 Hive Kafka ODSDWD DWD 实时离线一体数仓 DIM 打宽 DWS Kafka 服务层 (OLAP/KV/RDS) Hive DWS 服务层 (OLAP/KV/RDS) 流式入仓 DB/Kafka/Hive Kafka 业务数据库 业务日志 Binlog 采集 Flume CDC 日志采集 Flink #2 数据接入 Kafka 业务数据库 业务日志

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
本文主要介绍了Flink在数据集成方面的应用和优势。Flink支持数据仓库和数据集成的集成,提供数据集成的主要步骤:数据接入、数据清洗、数据入仓和入湖。数据仓库是一个集成的、面向主题的、随时间变化的、不可修改的数据集合,用于支持管理决策。Flink支持流式数据集成,可以处理实时、离线数仓的数据,并且支持全量读取和CDC增量读取。Flink的Temporal Join特性可以处理复杂的数据关联,支持多版本的数据状态,并且可以自动清理过期的数据。Flink还支持小文件的自动合并,并且可以将其与Iceberg数据湖结合,实现流式数据写入。总的来说,Flink提供了丰富的数据集成能力,包括全量读取、流式读取、CDC流式读取、维度关联、流式写入和CDC写入等,适用于各种不同的数据存储和处理场景。
"Flink如何实现数据集成?" "实时数据仓库如何构建?" "数据打宽在Flink中如何操作?"
客服
商务合作
小程序
服务号
折叠