当前位置:首页 > 报告详情

2林雨-滴滴实践.pdf

上传人: 拾亿 编号:751834 2025-07-29 19页 4.25MB

1、Presto迁移StarRocks在滴滴的实践林雨 大数据计算事业部内容摘要 背景与挑战 技术选型分析 平滑迁移实施方案 深度优化关键手段 稳定性建设 落地收益与未来规划PrestoPresto迁移迁移StarRocksStarRocks方案实方案实践践123456C O N T E N T S摘 要 目 录摘 要 目 录Presto迁移StarRocks的背景滴滴滴滴OLAP现状现状Presto迁移StarRocks的背景PrestoPresto面临的挑战面临的挑战-查询性能查询性能 复杂SQL平均响应60s(P95)多表Join效率骤降5-8倍-稳定性稳定性 hms/HDFS抖动导致故障率

2、上升 master单点设计造成极大隐患BI报表加速报表加速 日均处理 100w+查询 承载滴滴70%的报表看板Ad-Hoc探索探索 分析师日均 30w+查询 响应时间 30s(P90)数据产品数据产品 涵盖了算法特征平台/运营策略平台/结算平台等 日均 30w+查询PrestoPresto在滴滴的使用在滴滴的使用-资源消耗资源消耗 8000+vCore占用 混部业务相互干扰达35%-场景局限场景局限 仅支持Hive查询 实时分析需额外架构技术选型分析滴滴滴滴OLAPOLAP现有引擎对比现有引擎对比PrestoPresto迁移迁移StarRocksStarRocks核心驱动力核心驱动力指标指标S

3、tarRocksClickHouseDruidPresto节点规模节点规模600+节点/80+集群200+节点/20+集群300+节点/4+集群100+节点/7+集群核心优势核心优势 多表Join优化 联邦查询能力 存算分离架构 单机性能标杆 丰富内置函数 时序数据处理 高QPS支持 即席查询 语法兼容性性能表现性能表现SSB测试性能超ClickHouse 2.8倍单表查询响应5s查询P9030s业务承载业务承载 实时报表(1亿+/日)数据产品(1000W+/日)大宽表分析 日志处理 实时监控 时序分析 Ad-Hoc查询 Hive加速+查询速度提升查询速度提升 -TPC-H 100G测试:.6

4、s(vs Presto 39s)-复杂Join场景P95延迟:45s 15s+服务稳定性提升服务稳定性提升 -元数据缓存命中率99%-数据缓存降低HDFS访问量70%+湖仓一体架构湖仓一体架构-可查hive/iceberg/paimon等-支撑日志/实时看板/Ad-Hoc等+弹性资源管理弹性资源管理-满足滴滴内部多业务/多租户资源隔离-弹性扩缩容平滑迁移实施方案具体方案具体方案 双跑集群结果比对双跑集群结果比对1.动态兼容列表动态兼容列表更新机制更新机制:每日差异报告自动刷新缓存策略缓存策略:Redis集群,TTL=1hRedis语法错误枚举不同错误类型缺失函数结果不一致其他持久化1、从pre

5、sto审计日志每日采样sql2、在夜里空闲时段双跑在presto和sr集群上3、sql改造成去掉所有limit和order by后作为子查询查询1000条4、查询超时则人肉标记5、查询报错则分类报错类型6、查询成功则按字段类型映射只保留相应精度逐行对比比对步骤Presto字段类型Starrocks字段类型VarcharVARCHARDoubleDecimalIntegerbigintRealDoubleDateVarcharq浮点类型数据的误差在9E-5之内,认为数据一致;qint类型和varchar类型数据完全一致,认为数据一致;qDate类型按照字符串类型处理进行对比。平滑迁移实施方案具体

6、方案具体方案 路由决策流程路由决策流程2.路由决策流程路由决策流程目标集群满足条件StarRocksProxy网关层路由能力集群catalog库表Fe节点1、基于社区版fe代码二次开发2、对外提供mysql协议和http协议3、路由层元数据包括集群/账号/catalog/库/表等4、业务侧无需感知表的物理集群SRP介绍平滑迁移实施方案具体方案具体方案 降级熔断策略降级熔断策略3.降级熔断策略降级熔断策略触发条件触发条件处理方式处理方式监控指标监控指标语法错误立即降级错误率0.1%性能超时(65s)异步降级+结果缓存P99延迟资源不足队列排队后降级CPU利用率80%查询超时 业务侧在sql hi

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
本文主要讲述了滴滴公司从Presto迁移到StarRocks的实践过程。关键点如下: 1. 背景与挑战:Presto查询性能和稳定性存在不足,如复杂SQL响应时间长,多表Join效率低等问题。 2. 技术选型:StarRocks在节点规模、核心优势、性能表现等方面优于其他引擎,如ClickHouse、Druid和Presto。 3. 迁移实施方案:通过平滑迁移、路由决策流程、降级熔断策略等手段实现迁移。 4. 深度优化:进行方言翻译、函数兼容、hive表兼容等优化,提升查询性能。 5. 稳定性建设:对hms/namenode/datanode指标进行增强,升级StarRocks版本,提高稳定性。 6. 落地收益:迁移后,日均查询量提升至300万+,TP90查询延迟降低至7s,计算资源占用减少37.5%,高峰时段稳定性显著提高。 7. 未来规划:包括语法兼容层支持、DataCache优化、物化视图自动命中率提升等,以进一步降低成本和提高查询效率。 核心数据引用:日均查询量从120万提升至300万+,TP90查询延迟从30s降至7s,计算资源占用从8000 Core减少至5000 Core。
"迁移StarRocks,查询提速如何做到?" "滴滴如何节省百万成本?" "StarRocks深度优化,秘诀何在?"
客服
商务合作
小程序
服务号
折叠