阿里把大模型参数规模推向5万亿至10万亿,真正值得追问的并不是一个更大的数字,而是:当模型从万亿级继续放大,最先受限的还会只是芯片吗?
公开信息显示,吴泳铭提出,Qwen团队计划训练5—10T参数规模的新模型,目标是处理更复杂、更长程的任务,并向ASI方向推进。这个表述目前属于公司规划和技术目标,尚不足以等同于模型已经完成训练,也不能直接换算成阿里未来某一项目的具体采购额。
但从产业机制看,参数规模上升会把压力沿着一条链条传导出去:模型训练需要更多算力和显存,参数与中间计算结果需要更大容量、更高带宽的存储;大量芯片协同工作,又要求服务器、智能网卡、片间互联和集群调度保持高效率;设备规模扩大后,数据中心的机柜、网络、制冷、土地、能源(850101)和并网能力都必须同步跟上。训练是一次性的集中消耗,推理则可能在模型被广泛调用后形成持续的算力需求,二者共同决定基础设施能否真正承载模型能力。
阿里已经公开给出“AI模型、AI芯片、AI云”三层框架。模型是应用和能力的上游,芯片提供计算基础,云则负责把分散的算力、存储和数据中心组织成可调用的服务。阿里云副总裁霍嘉提到,Token消耗正在增长,价格上涨与需求爆发、模型能力提高及企业生产力提升有关。若企业侧调用持续扩大,产业链的价值量就不只集中在训练阶段,而会进一步延伸到推理、云服务和日常运维。
芯片之后,服务器和高速互联可能成为更容易被忽视的瓶颈。
平头哥发布的真武V900,公开资料给出的信息包括:算力约为上一代真武M890的3倍,配备216GB显存,片间互联带宽达到1200GB/s,单一集群可扩展至50万卡,计划于2027年第一季度量产。对超大规模模型而言,单颗芯片的峰值性能并不等于集群的有效性能。芯片之间传输参数和中间结果的效率、服务器内部拓扑、网络拥塞控制以及任务调度能力,都会影响最终训练速度和推理成本。
平头哥的布局也不止GPU。公开报道提到,其数据中心芯片覆盖真武系列GPU、倚天系列CPU、磐脉系列智能网卡和ICN互联芯片。这样的组合说明,大模型竞争正在从“买到多少加速卡”转向整套系统能否协同:CPU负责通用计算和调度,GPU承担主要 AI 计算,智能网卡和互联芯片减少通信环节的损耗,软件系统则决定大规模集群能否稳定运行。
这也是阿里自研芯片与AI云结合的意义所在。芯片、模型和云服务可以在架构上协同优化,理论上有助于提升资源利用率和成本控制能力。但公开信息尚未披露真武V900的实际量产进度、客户使用率,也没有证据表明阿里已经就相关产品向特定芯片、服务器或网络企业下达订单。产业链影响可以从机制上成立,具体企业的收入兑现仍需订单和出货验证。
超大模型的第二张资源清单,是电力和并网。
阿里披露的长期目标是,到2032年阿里云运营的全球数据中心规模超过20GW,较2022年增长10倍。这里的20GW是长期目标,公开信息尚不足以确认其具体口径究竟对应运营规模、装机容量还是数据中心容量,也不能把它理解为当前已经形成的采购规模,更不能据此推导某家能源(850101)设备企业的确定性订单。
高盛(GS)旗下Carbonomics团队的一份行业报告则从全球角度提示了约束。报告预计,全球数据中心装机容量将从2025年的101GW增至2030年的217GW,2030年全球数据中心用电量较2025年增长约170%;受电网扩张滞后影响,表后发电容量预测被上调至67GW,并预计到2030年自备电厂将承担全球约25%的数据中心电力需求。报告还称,燃气轮机、往复式发动机和燃料电池(885775)合计可能供应美国28%、全球25%的数据中心电力需求。
这些数字描述的是行业预测,不是阿里项目的实际用电需求。它们揭示的矛盾是,算力中心建设速度可能快于输电线路和并网审批。高盛(GS)资料提到,美国新建高压输电线路年均里程已从2010年至2014年的1700英里降至2020年至2023年的350英里,2023年至2024年间仅新增55至125英里;从提交并网申请到商业运营的中位等待时间接近五年,部分行业数据甚至将电网接入周期(883436)估计到七年。
能源(850101)方案因此会出现分层。燃气轮机适合提供较大规模、相对稳定的电力,但供应周期(883436)和产能可能成为约束;往复式发动机更强调灵活调节,燃料电池(885775)适合分布式供能;小型模块化核反应堆被高盛(GS)视为2030年后可能规模化的长期方案,但建设周期(883436)意味着其大规模落地难以在2030年前实现。不同方案的成本、燃料来源、碳排放、审批条件和运行方式并不相同,不能因为数据中心缺电,就推断某一种能源(850101)路线已经成为阿里的确定选择。
产业链观察需要把“需求增长”和“业绩兑现”拆开。芯片、显存、服务器、光互联、制冷和能源(850101)设备都可能受益于算力扩张;国家统计局数据显示,相关新兴场景带动下,1—8月份光电子器件制造和半导体(881121)分立器件(884090)制造利润分别增长72.0%和51.8%,这可以作为行业景气的侧面印证。但单个企业能否把需求转化为利润,还取决于技术路线是否被采用、产品是否量产、产能是否及时释放,以及数据中心是否按期投运。
后续更值得跟踪的变量有五个:真武V900能否按计划量产,超大模型训练和推理是否出现可持续的Token需求,阿里云数据中心新增容量的实际投运节奏,能源(850101)合同与并网进度,以及云业务收入和客户使用率能否同步提升。只有这些指标逐步落地,20GW和5万亿至10万亿参数才会从战略刻度变成可验证的商业规模。
阿里的布局把AI竞赛的约束地图拉长了:瓶颈可能从芯片供给迁移到服务器组装、集群互联、工程交付,再迁移到电力和并网。市场可以提前交易这种长期预期,但预期不是订单,规划也不是收入。对产业链而言,真正的分水岭不在于谁先喊出更大的参数,而在于谁能把算力、网络、数据中心和能源(850101)系统稳定地交付出来,并以足够高的利用率收回投入。
公开信息显示,吴泳铭提出,Qwen团队计划训练5—10T参数规模的新模型,目标是处理更复杂、更长程的任务,并向ASI方向推进。这个表述目前属于公司规划和技术目标,尚不足以等同于模型已经完成训练,也不能直接换算成阿里未来某一项目的具体采购额。
但从产业机制看,参数规模上升会把压力沿着一条链条传导出去:模型训练需要更多算力和显存,参数与中间计算结果需要更大容量、更高带宽的存储;大量芯片协同工作,又要求服务器、智能网卡、片间互联和集群调度保持高效率;设备规模扩大后,数据中心的机柜、网络、制冷、土地、能源(850101)和并网能力都必须同步跟上。训练是一次性的集中消耗,推理则可能在模型被广泛调用后形成持续的算力需求,二者共同决定基础设施能否真正承载模型能力。
阿里已经公开给出“AI模型、AI芯片、AI云”三层框架。模型是应用和能力的上游,芯片提供计算基础,云则负责把分散的算力、存储和数据中心组织成可调用的服务。阿里云副总裁霍嘉提到,Token消耗正在增长,价格上涨与需求爆发、模型能力提高及企业生产力提升有关。若企业侧调用持续扩大,产业链的价值量就不只集中在训练阶段,而会进一步延伸到推理、云服务和日常运维。
芯片之后,服务器和高速互联可能成为更容易被忽视的瓶颈。
平头哥发布的真武V900,公开资料给出的信息包括:算力约为上一代真武M890的3倍,配备216GB显存,片间互联带宽达到1200GB/s,单一集群可扩展至50万卡,计划于2027年第一季度量产。对超大规模模型而言,单颗芯片的峰值性能并不等于集群的有效性能。芯片之间传输参数和中间结果的效率、服务器内部拓扑、网络拥塞控制以及任务调度能力,都会影响最终训练速度和推理成本。
平头哥的布局也不止GPU。公开报道提到,其数据中心芯片覆盖真武系列GPU、倚天系列CPU、磐脉系列智能网卡和ICN互联芯片。这样的组合说明,大模型竞争正在从“买到多少加速卡”转向整套系统能否协同:CPU负责通用计算和调度,GPU承担主要 AI 计算,智能网卡和互联芯片减少通信环节的损耗,软件系统则决定大规模集群能否稳定运行。
这也是阿里自研芯片与AI云结合的意义所在。芯片、模型和云服务可以在架构上协同优化,理论上有助于提升资源利用率和成本控制能力。但公开信息尚未披露真武V900的实际量产进度、客户使用率,也没有证据表明阿里已经就相关产品向特定芯片、服务器或网络企业下达订单。产业链影响可以从机制上成立,具体企业的收入兑现仍需订单和出货验证。
超大模型的第二张资源清单,是电力和并网。
阿里披露的长期目标是,到2032年阿里云运营的全球数据中心规模超过20GW,较2022年增长10倍。这里的20GW是长期目标,公开信息尚不足以确认其具体口径究竟对应运营规模、装机容量还是数据中心容量,也不能把它理解为当前已经形成的采购规模,更不能据此推导某家能源(850101)设备企业的确定性订单。
高盛(GS)旗下Carbonomics团队的一份行业报告则从全球角度提示了约束。报告预计,全球数据中心装机容量将从2025年的101GW增至2030年的217GW,2030年全球数据中心用电量较2025年增长约170%;受电网扩张滞后影响,表后发电容量预测被上调至67GW,并预计到2030年自备电厂将承担全球约25%的数据中心电力需求。报告还称,燃气轮机、往复式发动机和燃料电池(885775)合计可能供应美国28%、全球25%的数据中心电力需求。
这些数字描述的是行业预测,不是阿里项目的实际用电需求。它们揭示的矛盾是,算力中心建设速度可能快于输电线路和并网审批。高盛(GS)资料提到,美国新建高压输电线路年均里程已从2010年至2014年的1700英里降至2020年至2023年的350英里,2023年至2024年间仅新增55至125英里;从提交并网申请到商业运营的中位等待时间接近五年,部分行业数据甚至将电网接入周期(883436)估计到七年。
能源(850101)方案因此会出现分层。燃气轮机适合提供较大规模、相对稳定的电力,但供应周期(883436)和产能可能成为约束;往复式发动机更强调灵活调节,燃料电池(885775)适合分布式供能;小型模块化核反应堆被高盛(GS)视为2030年后可能规模化的长期方案,但建设周期(883436)意味着其大规模落地难以在2030年前实现。不同方案的成本、燃料来源、碳排放、审批条件和运行方式并不相同,不能因为数据中心缺电,就推断某一种能源(850101)路线已经成为阿里的确定选择。
产业链观察需要把“需求增长”和“业绩兑现”拆开。芯片、显存、服务器、光互联、制冷和能源(850101)设备都可能受益于算力扩张;国家统计局数据显示,相关新兴场景带动下,1—8月份光电子器件制造和半导体(881121)分立器件(884090)制造利润分别增长72.0%和51.8%,这可以作为行业景气的侧面印证。但单个企业能否把需求转化为利润,还取决于技术路线是否被采用、产品是否量产、产能是否及时释放,以及数据中心是否按期投运。
后续更值得跟踪的变量有五个:真武V900能否按计划量产,超大模型训练和推理是否出现可持续的Token需求,阿里云数据中心新增容量的实际投运节奏,能源(850101)合同与并网进度,以及云业务收入和客户使用率能否同步提升。只有这些指标逐步落地,20GW和5万亿至10万亿参数才会从战略刻度变成可验证的商业规模。
阿里的布局把AI竞赛的约束地图拉长了:瓶颈可能从芯片供给迁移到服务器组装、集群互联、工程交付,再迁移到电力和并网。市场可以提前交易这种长期预期,但预期不是订单,规划也不是收入。对产业链而言,真正的分水岭不在于谁先喊出更大的参数,而在于谁能把算力、网络、数据中心和能源(850101)系统稳定地交付出来,并以足够高的利用率收回投入。
