阿里巴巴(BABA)把大模型的参数规模推向5万亿至10万亿,真正值得追问的,并不是“模型会有多大”,而是:当模型进入大规模训练和推理阶段,现有算力集群能否把芯片组织成一个高效系统?
公开信息显示,阿里Qwen团队计划训练5—10T参数规模的新模型,目标是处理更复杂、更长程的任务,并向人工超智能方向推进。这一目标目前仍属于公司规划,公开信息尚不足以确认模型的具体架构、训练周期(883436)、芯片数量和最终落地形态。因此,产业影响不能简单理解为“参数规模扩大,所有算力设备同步受益”。更确定的变化,是AI基础设施的瓶颈将从单卡性能进一步延伸到集群之间的连接效率。
为什么参数越大,网络越重要
训练和推理不是芯片各自独立完成的工作。大量数据需要在芯片、服务器、交换机和机架之间持续交换;集群规模越大,传输频率越高,网络层级也越复杂。只要带宽不足、延迟过高,或者高速信号在传输中出现质量下降,加速卡就可能因为等待数据而空转。
这构成了“峰值算力”和“有效算力”之间的差距。新增芯片并不必然带来等比例的有效算力增长,只有当计算、存储、通信和调度能够协同,集群规模扩张才可能转化为实际产出。对于5万亿至10万亿参数模型,显存容量、片间通信、参数分片、任务调度和故障恢复都会面临更高要求,但具体需求规模仍不能仅凭参数量作出确定判断。
阿里此前披露,真武V900算力约为上一代真武M890的3倍,配备216GB显存,片间互联带宽达到1200GB/s,单集群可扩展至50万卡,并计划于2027年第一季度量产。这些参数属于阿里及平头哥披露口径,后续仍需通过量产进度和真实应用验证。阿里还称,M890已经能够支撑超过2万亿参数大模型的高效推理,但具体模型、并行方式和业务场景仍待进一步披露,不能据此直接推导其对5万亿至10万亿模型的适用能力。
高速互连不是一条单一产品线
在AI集群中,SerDes、Retimer、oDSP、交换芯片和光模块承担不同任务。SerDes负责并行数据与高速串行信号之间的转换,是芯片、板卡和设备实现高速通信的基础接口;Retimer主要用于高速电信号的恢复与重定时,以改善长距离或复杂链路中的信号质量;oDSP则承担光模块内部的数字信号处理,将高速电信号和光通信链路连接起来。
交换机负责网络流量组织,光模块承担设备之间的光电转换。几类器件共同构成从芯片、服务器、交换机到机架的系统性互连能力,任何一环出现性能、可靠性或兼容性问题,都可能影响整机集群效率。
400G、800G向1.6T演进,带来的不只是产品数量增加,也可能改变单器件价值量、散热设计、功耗管理和测试要求。高速互连的产业机会因此具有双重属性:一方面,端口数量、网络层级和光连接需求可能随集群扩大而增长;另一方面,速率升级会抬高单器件技术门槛,供应商能否完成稳定量产,比单纯获得概念关注更重要。
阿里处在“芯片—超节点—云”的协同尝试中
阿里已经把AI模型、AI芯片和AI云定义为机器智能时代的三大基石。平头哥目前披露的芯片布局包括真武系列GPU、倚天系列CPU、磐脉系列智能网卡和ICN互联芯片。阿里还提出,到2032年,阿里云运营的全球数据中心规模将超过20GW,较2022年增长10倍。
如果说芯片负责生产Token,数据中心和网络则负责输送Token。自研芯片、超节点、互联协议与云服务之间形成协同,理论上可以减少软硬件适配环节,改善模型训练、推理和部署效率,也有助于阿里控制部分基础设施成本。但协同能力不能直接等同于商业壁垒已经形成,最终仍要看芯片量产、软件生态、客户采用和持续运维能力。
UALink提供了另一个观察窗口。AMD、思科(CSCO)、英特尔(INTC)、阿里等企业参与推动这一开放互联协议,说明AI集群连接正在从单一厂商封闭方案,向更开放的标准协作演进。但“参与推动”不等于阿里已经主导该标准,协议进展、兼容性和产业落地仍需后续验证。
国产替代的机会,先要穿过验证周期(883436)
高速互连可能成为国产算力供应链的新增切口,但海外厂商在Retimer、oDSP和高速SerDes IP等环节仍占据较高份额。国内企业若要进入头部客户供应链,需要同时解决技术补齐、稳定量产、良率控制和长期验证等问题。
对供应商而言,真正有价值的指标不是“进入某个热门赛道”,而是产品速率能否跟上迭代,能否通过客户测试,能否实现批量供货,并在高负载场景下保持稳定。单一企业的产品、客户验证或收入案例,只能说明个案进展,不能代表整个国产高速互连行业已经完成替代。
后续观察应集中在五个变量:V900的实际量产时间与应用场景,M890及后续芯片对大模型推理的具体验证,400G、800G和1.6T产品的出货与良率,阿里超节点和UALink的生态落地,以及国内厂商进入头部客户后的批量订单和客户集中度。
5万亿至10万亿参数模型的产业意义,或许不在于制造一个更大的数字,而在于迫使AI基础设施重新回答一个朴素问题:有多少算力能够真正被连接、调度并稳定使用。模型规划可以带来需求预期,只有互连性能、量产能力和客户验证逐项兑现,产业链机会才可能从预期走向收入。
公开信息显示,阿里Qwen团队计划训练5—10T参数规模的新模型,目标是处理更复杂、更长程的任务,并向人工超智能方向推进。这一目标目前仍属于公司规划,公开信息尚不足以确认模型的具体架构、训练周期(883436)、芯片数量和最终落地形态。因此,产业影响不能简单理解为“参数规模扩大,所有算力设备同步受益”。更确定的变化,是AI基础设施的瓶颈将从单卡性能进一步延伸到集群之间的连接效率。
为什么参数越大,网络越重要
训练和推理不是芯片各自独立完成的工作。大量数据需要在芯片、服务器、交换机和机架之间持续交换;集群规模越大,传输频率越高,网络层级也越复杂。只要带宽不足、延迟过高,或者高速信号在传输中出现质量下降,加速卡就可能因为等待数据而空转。
这构成了“峰值算力”和“有效算力”之间的差距。新增芯片并不必然带来等比例的有效算力增长,只有当计算、存储、通信和调度能够协同,集群规模扩张才可能转化为实际产出。对于5万亿至10万亿参数模型,显存容量、片间通信、参数分片、任务调度和故障恢复都会面临更高要求,但具体需求规模仍不能仅凭参数量作出确定判断。
阿里此前披露,真武V900算力约为上一代真武M890的3倍,配备216GB显存,片间互联带宽达到1200GB/s,单集群可扩展至50万卡,并计划于2027年第一季度量产。这些参数属于阿里及平头哥披露口径,后续仍需通过量产进度和真实应用验证。阿里还称,M890已经能够支撑超过2万亿参数大模型的高效推理,但具体模型、并行方式和业务场景仍待进一步披露,不能据此直接推导其对5万亿至10万亿模型的适用能力。
高速互连不是一条单一产品线
在AI集群中,SerDes、Retimer、oDSP、交换芯片和光模块承担不同任务。SerDes负责并行数据与高速串行信号之间的转换,是芯片、板卡和设备实现高速通信的基础接口;Retimer主要用于高速电信号的恢复与重定时,以改善长距离或复杂链路中的信号质量;oDSP则承担光模块内部的数字信号处理,将高速电信号和光通信链路连接起来。
交换机负责网络流量组织,光模块承担设备之间的光电转换。几类器件共同构成从芯片、服务器、交换机到机架的系统性互连能力,任何一环出现性能、可靠性或兼容性问题,都可能影响整机集群效率。
400G、800G向1.6T演进,带来的不只是产品数量增加,也可能改变单器件价值量、散热设计、功耗管理和测试要求。高速互连的产业机会因此具有双重属性:一方面,端口数量、网络层级和光连接需求可能随集群扩大而增长;另一方面,速率升级会抬高单器件技术门槛,供应商能否完成稳定量产,比单纯获得概念关注更重要。
阿里处在“芯片—超节点—云”的协同尝试中
阿里已经把AI模型、AI芯片和AI云定义为机器智能时代的三大基石。平头哥目前披露的芯片布局包括真武系列GPU、倚天系列CPU、磐脉系列智能网卡和ICN互联芯片。阿里还提出,到2032年,阿里云运营的全球数据中心规模将超过20GW,较2022年增长10倍。
如果说芯片负责生产Token,数据中心和网络则负责输送Token。自研芯片、超节点、互联协议与云服务之间形成协同,理论上可以减少软硬件适配环节,改善模型训练、推理和部署效率,也有助于阿里控制部分基础设施成本。但协同能力不能直接等同于商业壁垒已经形成,最终仍要看芯片量产、软件生态、客户采用和持续运维能力。
UALink提供了另一个观察窗口。AMD、思科(CSCO)、英特尔(INTC)、阿里等企业参与推动这一开放互联协议,说明AI集群连接正在从单一厂商封闭方案,向更开放的标准协作演进。但“参与推动”不等于阿里已经主导该标准,协议进展、兼容性和产业落地仍需后续验证。
国产替代的机会,先要穿过验证周期(883436)
高速互连可能成为国产算力供应链的新增切口,但海外厂商在Retimer、oDSP和高速SerDes IP等环节仍占据较高份额。国内企业若要进入头部客户供应链,需要同时解决技术补齐、稳定量产、良率控制和长期验证等问题。
对供应商而言,真正有价值的指标不是“进入某个热门赛道”,而是产品速率能否跟上迭代,能否通过客户测试,能否实现批量供货,并在高负载场景下保持稳定。单一企业的产品、客户验证或收入案例,只能说明个案进展,不能代表整个国产高速互连行业已经完成替代。
后续观察应集中在五个变量:V900的实际量产时间与应用场景,M890及后续芯片对大模型推理的具体验证,400G、800G和1.6T产品的出货与良率,阿里超节点和UALink的生态落地,以及国内厂商进入头部客户后的批量订单和客户集中度。
5万亿至10万亿参数模型的产业意义,或许不在于制造一个更大的数字,而在于迫使AI基础设施重新回答一个朴素问题:有多少算力能够真正被连接、调度并稳定使用。模型规划可以带来需求预期,只有互连性能、量产能力和客户验证逐项兑现,产业链机会才可能从预期走向收入。
