当前位置:首页 > 报告详情

【01】胡伟华&辛朝晖-超大规模 Flink 调度优化.pdf

上传人: li 编号:29322 2021-02-07 36页 1.76MB

1、 ? ?-?-? ? ? ? 目录 Cont4nts 黑I单R制 Bl12klist M4261nism#2 相关背O B12k5roun3 启F速MC化 Bootstr1p Pro24ss OptimiB1tion#3 YM器C化 Y1rn S2643ul4r OptimiB1tion# 资源隔WC化 R4sour24 Isol1tion OptimiB1tion#5 未S展P Futur4 Work#6 相关背景 Backgroun# #1 业务规模 Bus1ness Scale 1 3+ strea51ng jo+s 8 3+ +atc0 jo+s 8er day 作业数量多 1 3+

2、yarn nodes QPS u8 to 5 M+ Parallel1s5 u8 to 3 3+ 机器规模大单作业并B大 问题和挑战 Problem and Challenge ?d? ?d?F?a ?CO? ? ? ? ?O? ? ?e?O ?I? 黑名单机制 Bla#klist Me#hanism #2 常U问题 Common %0oblem 磁N、内A、C%U R异常 难以 1 % 检测到 基础P件问题 作业依赖的 Agen1 没有托 管到 YARN,发生故障后 仍会Y行调C 软件环境问题 异常节点处N逻U Handle with Unhealthy N1de 1、Ta3k 异常不会销毁

3、 Ta3kManage2,重新调 度后仍M失T 2、Ta3kManage2 异常重新申请仍J可能分配到 异常节点 3、J1b 重新H交也J可能将 TM 分配到异常节点 h名单Y制 B3ac231st Mecha51s4 1、T持 Tas2 和 Tas2Ma5ager 两个维度 、T持异常e滤,减N误E,B如 Re4oteTra5sportExcept1o5 等异常 3、A动释放异常 Tas2Ma5ager 4、异常c点上Ra YARN 5、h名单具有M时清理,最大g度策略 +线收益 B%n%fits 每天9 100+ 1业触2了拉B操1 触2拉B节点的1业中 90% 拉B 20 台0下机器 启动速3优化 Bootstr#p Process Optimiz#tion #3 1业启动时间不稳定1业启动时间U经验和用户反 馈来估计,没有3体的指F 常见用户反馈 #ser Feedback #2#

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
本文主要探讨了大数据处理平台YARN在资源调度、作业启动优化、异常处理和资源隔离等方面的挑战与解决方案。关键数据包括:每天有100+业务触发拉取操作,90%的业务拉取涉及20台以下机器的启动;在作业启动过程中,5%的TasManager能在10秒内启动,而5%超过了10秒,部分甚至超过40秒;使用Session模式可以控制重启作业的耗时在3秒以内;支持设置CPU限制上限和NUMA绑核,提升磁盘IOPS性能2倍。文章提出了包括优化作业启动恢复速度、支持OLAP场景、探索Auto Scaling、丰富的调度策略和调度自动化等未来展望。
如何优化作业启动速度? 如何解决作业重启问题? 如何提升资源隔离效果?
客服
商务合作
小程序
服务号
折叠