您的当前位置:首页 > 标签 > 智算网络创新实践
新华三:2026数智化转型最佳实践案例集(84页).pdf
2026智算网络创新实践:小红书DDC架构GPU单卡吞吐量385Gbps,宁夏电信400G无损网络硬件成本降低40%|新华三
新华三智算网络创新实践深度解读:小红书国内首个DDC架构智算集群规模化验证,宁夏电信400G超宽无损网络硬件成本降低40%+,福建移动异构智算调度平台10分钟完成GPU交付。
 2026-07-31
 数字化
 84页
14张图表
数据来源:
新华三:2026数智化转型最佳实践案例集(84页) 查看报告
小红书的AI训练集群跑出了单卡385Gbps的吞吐量,靠的是国内首个DDC架构;宁夏电信的400G无损网络把硬件成本砍掉40%,同时做到了1:1上下行无收敛。当大模型从"能不能训"变成"训得快不快",新华三的智算网络创新正在把算力传输的瓶颈一个一个打通。

小红书——国内首个DDC架构智算网络集群

随着大模型快速发展,智算网络正面临机间通信占比激增带来的拥塞风险、低时延与高吞吐双重压力、以及动态流量模式导致传统调优失效三大主要挑战。小红书基础网络团队自2023年起积极布局高性能网络方案,携手新华三率先完成了国内首个基于DDC架构的智算网络规模化验证。

DDC架构(Diversified Dynamic-Connectivity,多元动态联接)采用分布式设计,通过信元交换技术实现网络100%负载均衡,并结合VOQ+Credit智能流量调度,实现训练集群的无阻塞转发和极速通信。该架构首次将信元交换与以太网协议融合,构建以太网原生的全局调度能力,实现端侧完全解耦,兼容主流GPU厂商,并顺应国产GPU趋势。网络具备免调参能力,大幅降低运维和部署复杂度。DDC架构全面适配All-Reduce、All-to-All等主流集合通信,为Dense、MoE等大模型提供稳定高效支撑。

规模化验证交出亮眼成绩单

在测试阶段,双方团队根据小红书智算业务高并发、大流量特点,开展了带宽和延迟基准测试、All-to-All和All-Reduce集合通信测试,以及系统容灾测试。结果显示:All-to-All场景中,GPU单卡吞吐量最高可达381.83Gbps;All-Reduce场景中,GPU单卡吞吐量更可达到385.98Gbps。架构可快速响应多种硬件故障,智能调度带宽资源,实现即插即用和"网络内免调参",显著简化运维工作。

上线测试基于已部署完毕的DDC智算网络集群,使用2台NCF交换机、8台NCP交换机、4台GPU服务器,每台GPU服务器配备8张卡。基于DDC架构的智算交换机H3C S12500AI系列在实际部署中充分体现了其价值,不仅提升了大规模智算网络的负载能力,缩短了模型训练时间,还为小红书的AI应用提供了高效、可靠的算力基础。小红书基础网络负责人表示,该方案在先进性与普适性之间取得了良好平衡,为行业提供了高性能、低成本且易部署的网络新选择。

宁夏电信——400G超宽无损网络打造"东数西算"样板

宁夏中卫建成了国家级新型互联网交换中心——西部唯一获批的国家级交换节点,与国家一体化大数据中心共同构成"双中心"格局。中国电信宁夏数据中心总建筑面积达6.8万平方米,配备20万核通用算力与7000PFLOPS智能算力,服务覆盖全国,支撑700多个政务系统、100多家互联网医院、800所学校及300余家工业企业的计算与存储需求。

面对千卡、万卡级别的超大规模集群,宁夏电信携手新华三创新采用基于以太网的RoCE技术。相较于InfiniBand方案,RoCE网络在保持同等低延迟、高吞吐能力的同时,硬件成本降低了约40%-50%。同时,得益于开放的产业生态和成熟的供应链体系,设备供货周期也缩短至原来的1/10。

从"黑盒"到"可视、可管、可调"

新华三为宁夏电信量身打造了基于Spine-Leaf的智算网络架构,并采用H3C S9825系列400G高速交换机,实现Spine与Leaf层间上下行带宽1:1配置,有效解决了数据在集群内部高频传输带来的拥塞问题,为后续算力规模的平滑扩容提供了充足弹性。方案引入基于以太网RoCE架构的ACL访问控制机制,实现多租户算力隔离管理,资源申请可实现分钟级上线。

在运维层面,借助SDN等技术手段,宁夏电信逐步实现了对前端节点与后端GPU集群互联状态的统一管理,能够实时掌握网络中的会话、流量、路径及负载分布情况。围绕延迟、抖动、故障、性能波动等场景,构建起涵盖预警、分析、定位与决策的智能化机制。经实际运行验证,网络故障平均定位时间缩短超过90%,运维效率和响应能力大幅提升。

福建移动——一体化异构智算调度平台

中国移动福建有限公司携手新华三打造一体化异构资源云上智算调度平台,部署近200台GPU服务器、两千余张涵盖国产及商用GPU卡,打造混合异构算力池;配套PB级分布式并行存储,构建RoCE无损智算网络。平台基于新华三智能云和灵犀使能平台,纳管超10家厂商、70余款异构GPU。

平台实现四大核心能力:统一调度与管理——可视化门户支持资源按需申请与自动化部署;智能调度与优化——融合AI负载预测,模型训练效率提升超20%;全栈服务输出——对外提供IaaS、PaaS、SaaS全层级服务;智能运维体系——实现跨厂商GPU集中运维。平台预集成50+主流标准化大模型,支持一键部署、快速微调。

算力从"封闭专用"到"开放共享"

平台落地后,GPU资源申请交付从3天缩短至10分钟内,模型训练环境部署效率提升60%,训练任务周期缩短25%。新项目启动时间缩短70%,普通模型上线从2周压缩至1天。日常运维人工干预减少40%,故障定位从小时级降至5分钟内,系统可用性达99.95%。

目前,平台已实现GPU算力资源对内对外商业化运营,成为福建移动算力商业变现的重要载体。从打破"算力孤岛"到异构资源统一纳管,从支撑内部AI研发到推动算力商业化,福建移动智算调度平台为通信行业智算基础设施建设提供了可复制的实践范本。
客服
商务合作
小程序
服务号
折叠