[中国,雄安新区(885744),2026年7月25日] 第三届 CCF 分布式计算大会暨中国算力网大会于 2026 年 7 月 24 日 —26 日在河北雄安新区(885744)隆重启幕,本次大会以 “算力网:新质生产力背景下的分布式系统” 为主题。华为数据通信产品线DCN技术实验室主任管紫轩在大会上发表题为“大规模AI集群网络的挑战与实现”的演讲,指出大模型时代AI集群网络建设需聚焦“做更好的网,用得更好”两大核心方向。一方面需苦练内功,构筑规模更大、速率更高、稳定性更强的集群网络底座,以满足各类场景高带宽、大规模、低时延与高可靠的严苛要求;另一方面要巧出外招,推动网络与计算、存储、安全及AI等技术的深度耦合,为用户提供极致体验。
针对数十万卡级AI集群规模化部署与高效运行这一挑战,华为通过上述内外兼修的系统性创新,旨在彻底解决超大规模集群面临的通信瓶颈。本次演讲围绕网络拓扑架构、负载均衡机制、网存算融合等关键方向展开论述,为下一代智算集群基础设施建设描绘了清晰完整的技术路径。
突破传统架构瓶颈,多平面扁平化组网赋能超大规模AI集群高效演进
传统三层CLOS架构存在高时延、高成本、易产生拥塞等痛点,无法满足十万卡级 AI 集群的通信承载要求。面向未来更大规模的智算中心,多平面扁平化组网成为必然趋势。面对这一挑战,华为依托自主创新的100T交换机,率先实现了数十万卡规模的两层多平面组网。此外,华为突破性地构建了网卡与交换机协同机制,实现故障平面的毫秒级无缝切换;结合动态多平面负载均衡技术,实现全局带宽资源最优调度,有效提升多平面组网综合性能。
首创NPLB技术打破生态壁垒,引领AI集群网络从逐流迈向逐包
随着大模型向MoE稀疏化及PD/AE分离部署演进,网络通信呈现出高频、随机且复杂的特征,传统逐流负载均衡因响应慢、规划难而逐渐失效。为此,华为创新性地推出NPLB技术,采用网络喷洒和网卡级选择性重传机制实现了卓越的乱序接收能力,特别是面向小消息场景,通过后同步报文优化节省了一个RTT的时间开销。NPLB不仅解决了现有逐包方案高度依赖封闭网卡生态的痛点,更在确保大消息场景集合通信性能持平的基础上,将小消息场景的性能进一步提升了5%到17%。
深化网存算融合,释放多维协同价值,极致优化推理性能
长输入推理场景下,“以存代算”逐步成为行业主流技术路线,已得到国内外主流大模型服务商的广泛采用。华为采用存储节点参数面直连计算节点架构,大幅缓解了KV Cache高命中率场景下的网络瓶颈。针对查询数据分散在不同存储节点所引发的“多打一”通信难题,华为打造集拥塞控制、流量管控、优先级调度于一体的端网协同解决方案,持续提升网络带宽有效利用率。
“做更好的网”和“把网用更好”这两个方向必须双管齐下共同发力,不能厚此薄皮,才能打造AI集群网络新标杆。演讲最后,管紫轩发出诚挚呼吁。他表示,华为愿与业界共建开放标准,携手合作伙伴及行业组织,共同定义大模型时代的下一代智算集群网络接口,繁荣智算网络生态,共筑AI时代的坚实底座。
