您的当前位置:首页 > 标签 > RoCEv2网络监控
新华三:RDMA Telemetry技术白皮书(2026)(19页).pdf
RoCEv2网络监控:微秒级I/O质量可视与吞吐量可视,破解智算中心“通信墙”瓶颈|RDMA Telemetry
RoCEv2网络监控深度解读:I/O质量可视三段式DAL/RTT/DPL、吞吐量可视FCT/FET/FNR,微秒级精度破解AI训练通信瓶颈。
 2026-07-31
 信息技术
 19页
13张图表
数据来源:
新华三:RDMA Telemetry技术白皮书(2026)(19页) 查看报告
传统网络监控在RoCEv2网络中如同“盲人摸象”——采样间隔数百毫秒、无法捕捉微秒级延迟尖刺、无法精确定位万分之一丢包。RDMA Telemetry技术专为RoCEv2网络设计,I/O质量可视功能以三段式测量将DAL(数据访问时延)、RTT(双向时延)、DPL(数据准备时延)精准分解到计算侧、网络路径、存储侧;吞吐量可视功能以FCT(流完成时间)、FET(有效吞吐率)、FNR(重传率)评估GPU间梯度同步效率。当AI训练通信开销占总时长40%-60%时,这种微秒级、带内遥测的监控能力正在成为智算中心的“标配”。

RoCEv2网络监控的三大挑战

RoCEv2已成为智算中心GPU间同步和GPU-存储通信的核心标准,但传统监控(SNMP/NetAnalysis)面临精度不足(数百毫秒采样间隔无法捕捉微秒级延迟尖刺)、检测粗糙(无法精确定位万分之一丢包)、实时性差(被动轮询存在盲区)三大挑战。万分之一丢包在RoCEv2中会触发重传导致延迟骤升,万卡集群中每节省1%训练时间即可节约数百万美元。

I/O质量可视——三段式存储网络监控

I/O质量可视将存储路径分为计算侧、网络路径、存储侧三段独立测量。读操作记录T1-T5五时间戳,写操作记录T1-T7七时间戳,计算三大指标:DAL(数据访问时延)——存储设备处理I/O耗时,升高指示SSD延迟或存储软件栈过载;RTT(双向时延)——网络性能,突增指示拥塞或丢包;DPL(数据准备时延,仅写操作)——计算侧效率,升高指示CPU/内存瓶颈。运维人员据此快速定界:DAL高→存储侧、RTT高→网络侧(配合iFIT定位具体链路)、DPL高→计算侧。

吞吐量可视——计算平面梯度同步监控

吞吐量可视监控GPU服务器间纯RoCEv2 RDMA Write操作。三大指标:FCT(流完成时间)——单次RDMA写操作总耗时,直接反映训练通信延迟;FET(流有效吞吐率)——实际有效数据传输速率,衡量网络可用带宽;FNR(流重传率)——因丢包导致的重传占比,高FNR直接导致有效吞吐下降并可能引发PFC反应。支持全量监控和轮询监控两种模式,数据通过gRPC上报可视化。

应用价值——AI训练场景

千卡级GPU集群中数据加载I/O延迟波动可致GPU利用率下降40%以上;万卡集群大语言模型训练中梯度同步通信开销占总时间40%-60%。RDMA Telemetry提供统一性能视图,为计算、网络、存储团队提供量化数据,科学指导硬件升级、网络优化和存储调优。
客服
商务合作
小程序
服务号
折叠