当前位置:首页 > 报告详情

10-2 openLooKeng 基于高速协议的 MPP 数据库 Connector 方案实践.pdf

上传人: 云闲 编号:102491 2021-01-01 25页 3.33MB

1、 基于高速协议基于高速协议的的程一舰 中国人民大学硕士中国光大银行总行 openLooKeng项目负责人|openLooKengMppConnector数据库数据库实践实践0101背景介绍背景介绍openLooKeng介绍及金融场景痛点0202社区方案社区方案社区的方案0303优化方案优化方案我们的方案0404性能测试性能测试初步性能测试目录目录 CONTENT|背景介绍01|背景介绍openLooKeng引擎介绍|联邦查询联邦查询:openLooKeng引擎可以提供跨不同数据源、不同集群的联合查询即席查询即席查询:基于内存的计算使引擎能够快速进行查询计算响应,提供交互式的即席查询集群集群A:

2、Hive集群集群B:Hive集群集群C:MppDB/Kafka/HBase等等背景介绍openLooKeng引擎介绍|数据源连接器openLooKeng引擎支持多种不同的数据源连接器,通过不同的数据源连接器可以对接不同的数据源引擎可以支持用户根据标准接口实现自定义的数据源连接器自定义.背景介绍金融场景痛点介绍|Hadoop体系仓库体系仓库Hive/Hbase/kudu传统传统MPP仓库仓库GaussDB/Greenplum/Teradata数据搬家贴源数据数仓建模/集市历史或现实 持续或长期共存数据科学家数据分析师探查 建模.提工单、评审、投产目前一般套路背景介绍金融场景痛点介绍|数据源连接器

3、openLooKeng引擎支持多种不同的数据源连接器,通过不同的数据源连接器可以对接不同的数据源引擎可以支持用户根据标准接口实现自定义的数据源连接器Hadoop体系仓库体系仓库Hive传统传统MPP仓库仓库GaussDB/Greenplum/Teradata跨源联邦查询jdbcGB/TB?select *from hive.hdb1.htbl1 t1join gaussdb.gdb2.gtbl2 t2on t1.id=t2.id社区方案02|社区方案基础方案|实现机制openLooKeng引擎的openGauss Connector基于jdbc协议实现在进行数据读取时是通过GaussDB CN

4、节点读取存在问题openLooKeng引擎侧与GaussDB之间的数据传输是单节点出、单节点进(处理)的过程在进行大数据量读取的场景下效率非常低社区优化方案多jdbc连接方案|当前普遍的解决方案根据读取目标表的主键或某列的具体取值范围信息进行数据切片划分根据划分的切片数来决定创建的jdbc连接数仍存在的问题openLooKeng引擎端的并发解决了,但是数据依然从GaussDB的CN单节点出,并不能从根本上解决问题单CN出?多连接?分割键?数值型?不连续?社区优化方案谓词下推方案|谓词下推,动态过滤目前已经实现了部分的Filter下推,社区新增基于Connector的下推,可以进一步将更多算子根

5、据数据源特点进行下推,例如Limit、TopN、Aggregation 以及 Join 下推等。但是,对于全量或过滤后数据集依然很大的情况仍然无法解决。优化方案03|postgreSQL特性FDW机制|connectorcatalogfile_fdw:file connectormysql_fdw:mysql connectormongo_fdw:mongo connector一种外部数据源支持方式postgreSQL特性FDW机制|mysql_fdw_servermongo_fdw_serverfile_fdw_servergds_fdw_server基于GDS协议的方案GDS基于FDW机制

6、|openLooKeng并行处理并行读取HDFS DN节点的数据GDS数据快速读取创建GaussDB外表,挂载外部目录通过Insert操作触发GaussDB调用GDS服务将数据从DN节点并行导出到挂载的外部目录内存管道监听内存管道数据并导入到HDFS DN节点FDW实现hdfs dfs-copyFromLocal/tbl1/mem.pipe/gdsdata/tbl1/|基于GDS协议的方案处理流程-HDFSGDS基于FDW机制|Linux fuse机制fuse用户自定义文件系统在Linux中,对文件的访问都是统一通

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
本文主要介绍了openLooKeng项目,这是一个基于高速协议的金融场景解决方案,由中国人民大学硕士、中国光大银行总行openLooKeng项目负责人阐述。文章首先介绍了openLooKeng引擎,它可以提供跨不同数据源、不同集群的联合查询,支持即席查询和内存计算。然后,文章提出了金融场景的痛点,如Hadoop体系仓库和传统MPP仓库的问题,并介绍了openLooKeng引擎如何通过多种数据源连接器解决这些问题。 接下来,文章讨论了社区方案和优化方案。社区方案主要基于jdbc协议实现数据读取,但存在单节点进出效率低下的问题。因此,提出了优化方案,包括多jdbc连接方案和谓词下推方案,以提高数据处理效率。 此外,文章还介绍了postgreSQL的FDW机制,以及基于GDS协议的方案,该方案可以实现数据的快速读取和写入。最后,文章提到了性能测试的结果,初步测试显示,该方案最高可以提升4-5倍的性能,复用可提升20倍。总的来说,openLooKeng项目旨在解决金融场景下的数据处理问题,通过优化数据源连接和查询方式,提高数据处理速度和效率。
"openLooKeng如何实现跨源联邦查询?" "openLooKeng如何通过FDW机制优化性能?" "GDS协议在openLooKeng中的作用和优势是什么?"
客服
商务合作
小程序
服务号
折叠