算力满载,业务永续,华为星河AI数据中心网络持续创新,构筑AI Fabric智能算网新底座
[中国,北京,2026年9月3日]2026开放数据中心大会暨首届算博会(ODX)主论坛在北京成功举办。华为数据通信产品线数据中心网络领域总裁张白受邀参会并发表主题演讲,深度剖析AI时代算力产业发展趋势,围绕大规模组网、高算效互联、高可用机制三大技术方向,深入解读华为星河AI数据中心网络方案核心能力,为超大规模智算集群建设提供可行技术路径。
华为数据通信产品线数据中心网络领域总裁张白发表主题演讲
张白在演讲中指出,人工智能正推动人类迈向智能生产力时代。随着大模型快速迭代,行业应用重心逐步从AI训练转向AI推理,全网Token使用规模呈爆发式增长。业务场景持续演进,推动数据中心从传统应用中心、多云中心加速向算力中心转型,网络已然成为智算集群建设的关键底座。如何构建超十万卡级算力集群、降低大规模集群场景算力损耗、保障集群稳定运行,成为当前智算产业亟待解决的核心挑战。
针对上述行业痛点,华为星河AI数据中心网络方案基于产业界最新推出的AI Fabric智能算网理念,聚焦大规模组网、高算效互联和高可用机制三大关键技术,系统性破解算力集群建设难题。
在大规模组网方面,华为基于自研业界最高密100T交换机,搭建两层多平面架构,相较于业界传统三层组网方案,十万卡集群可实现交换机、光模块数量减少70%,建网成本降低40%。同时,华为今年全新推出全自研51.2T NPO交换机,搭载3.2T OE光引擎,整机功耗降低20%。
在高算效互联方面,网络负载均衡是算效释放的关键。华为NPLB逐包负载均衡技术,实现任意场景吞吐最优,包流动态调度保障网络0抖动,集群训练性能损耗降低2%-7%。同时,华为推出星域超融合架构,实现存算一网承载,KV带宽提升8倍,依托端网协同将推理TPS性能进一步提升15%-20%。
在高可用机制方面,华为围绕设备、链路和光模块三层维度构建高可用体系,保障AI集群稳定运行、训推业务不中断,将网络引发的业务中断次数降低90%。设备层面,闪启2.0技术将设备重启时间从10秒压缩至5秒,实现训推业务不中断;链路层面,在故障毫秒级快切基础上,新增链路层重传LLR能力,实现链路误码或故障场景下微秒级重传,闪断0丢包;光模块层面,依托华为星联光模块,配合短距光回损定位技术,1分钟即可排查光纤松动、脏污问题,提前消除故障隐患。
张白表示,未来华为将持续深耕智能算网赛道,深化AI Fabric智能算网架构迭代与行业标准共建,与产业伙伴携手打造AI Fabric智能算网新底座,助力千行百业智能化升级。