阿里巴巴(BABA)把AI竞争的筹码,推向了一个极大的尺度:Qwen团队计划训练参数量达到5万亿至10万亿的全新模型,目标是处理更复杂、更长程的任务,并向ASI方向推进。
真正值得追问的问题不是“模型参数有多大”,而是这项计划能否沿着芯片、互联、服务器、数据中心和云服务逐层传导,最终形成可持续的商业需求。
阿里CEO吴泳铭已经给出了“AI模型、AI芯片、AI云”三大基石的框架。公开披露的信息还显示,阿里云计划到2032年运营的全球数据中心规模超过20GW,较2022年增长10倍。20GW是长期目标,不是已经建成的容量,也不能直接等同于近期订单或当前电力消耗。阿里押注的,实际上是一场从模型能力到基础设施供给的系统工程。
一、超大模型为何会抬高基础设施需求
训练和推理是两种不同的算力生意。
训练超大模型,需要大规模集群在较长时间内持续运行,核心约束集中在芯片数量、显存容量、片间通信、数据吞吐和集群稳定性。模型训练完成后,推理需求又会以另一种方式出现:用户调用、企业部署和智能体执行任务,都需要持续占用算力。尤其是长程任务和智能体应用,可能不是一次问答就结束,而是持续规划、调用工具、读取数据并反复修正,推理资源因此更接近长期在线的供给能力。
但参数量并不是算力需求的唯一决定因素。模型架构、训练数据规模、精度、并行方式、是否采用稀疏计算,以及最终调用频率,都会改变实际算力消耗。5万亿至10万亿参数首先是能力和工程目标,不能直接换算成芯片采购量、服务器数量或数据中心功率。
阿里在云栖大会披露,递归自我改进技术已初步进入模型训练、推理及芯模协同环节,Qwen4正在训练。若这类技术进一步用于模型研发和软硬件协同,算力需求的增长可能不只来自一次性训练,也来自持续迭代、评测和推理服务。
二、第一层传导:芯片竞争从单卡指标走向集群效率
真武V900是观察阿里芯片布局的一个窗口。按公开披露信息,该芯片算力为上一代M890的3倍,配备216GB显存,片间互联带宽达到1200GB/s,单集群可扩展至50万卡,并计划于2027年第一季度量产。
这些指标对超大模型的重要性,并不只在于“算力更高”。参数规模扩大后,模型状态、训练数据和中间结果需要在更大范围内被存取和交换。显存容量影响单卡能够承载的工作量,片间互联影响通信等待,集群扩展能力则决定系统能否从小规模验证走向大规模部署。
平头哥目前还被披露已布局真武系列GPU、倚天系列CPU、磐脉系列智能网卡和ICN互联芯片。芯片、网卡、互联和云平台若能协同设计,阿里可以尝试降低系统适配成本,并改善自研芯片的供给保障能力。
然而,纸面性能不等于实际集群效率。超大集群还要面对软件栈适配、通信调度、故障隔离、任务恢复和不同工作负载的利用率问题。V900的量产时间、实际商用规模、客户部署情况和运行效率,公开信息尚不足以确认。将芯片披露参数直接等同于完整国产替代能力,也缺乏足够依据。
三、第二层传导:算力中心不只是服务器采购
如果说芯片负责生成Token,数据中心就是把Token输送到用户和企业的网络。超大模型训练带来的需求,会继续传导至服务器整机、高速网络、存储系统、供电、制冷、土地和工程交付。
数据中心以GW计量,本身就说明竞争不再局限于单一硬件。大规模集群需要稳定电力、适配高密度算力的制冷系统、足够的网络带宽和持续运维能力。集群越大,交付周期(883436)、故障管理和系统稳定性越可能成为决定可用产能的关键因素。
阿里提出到2032年全球数据中心规模超过20GW,说明其长期目标已从“采购算力”延伸至“组织算力供给”。但20GW究竟对应运营规模、装机容量,还是其他数据中心容量口径,仍需进一步明确。报道提到阿里此前有3800亿元三年投入计划,这类投入计划也不能直接与20GW目标、当期资本开支或已签订单画等号,最终仍应以公司财报和项目投产信息验证。
因此,产业链判断不能停留在“数据中心扩张会带来设备需求”。只有当项目取得电力、土地和网络条件,设备完成交付,集群正式上线并产生收入,长期规划才会转化为现实产能。
四、第三层传导:云服务能否承接新增供给
基础设施投资的终点,不是机房亮灯,而是云平台能够以可接受的价格持续提供模型服务。
阿里云已经展示了多类AI应用,包括依托千问大模型的智能近视管理眼镜、金融AI终端和企业数字员工。云上超节点和模型服务如果能够规模化供给,超大模型就有机会通过API调用、企业订阅和行业部署消化推理资源。
商业化仍取决于三个变量:API价格能否覆盖推理成本,企业是否愿意把高频业务迁移到云端,以及应用能否形成稳定调用量。模型降本会扩大使用范围,却也可能压低单次调用价格。若应用增长速度低于算力供给扩张速度,数据中心和集群利用率就可能承压。
智能体的扩张还会带来另一类需求。机构观点认为,AI安全治理将延伸至数据、模型、软件、算力和平台等供应链环节,身份权限管理、数据安全(885942)、可信追溯和预警机制可能成为企业级部署的基础设施。也就是说,超大模型的产业影响不只体现在算力设备,还会推动安全、运维和治理能力进入交付清单。
五、比订单更重要的五个观察指标
第一,看数据中心实际投产进度,而不是只看2032年目标。第二,看真武V900是否按计划量产,以及是否出现可验证的客户部署和稳定运行记录。第三,看集群利用率、单位推理成本和长程任务的服务效率,这些指标比峰值算力更接近商业价值。第四,看阿里云相关收入和资本开支是否兑现,区分规划、投入、产能、订单和收入五个层次。第五,看开发者与企业客户能否持续留存,应用调用是否从展示性案例转为高频生产需求。
阿里训练5万亿至10万亿参数模型,可能推动AI产业链从“买芯片”走向“建系统”:芯片、互联、服务器、数据中心、电力、云服务和安全治理被纳入同一条传导链。但这条链条并非每一环都会同步受益,也不存在从模型参数直接推导订单的简单公式。
市场当前交易的更多是长期基础设施预期。真正决定产业景气成色的,将是模型训练能否落地、芯片能否量产、集群能否高效运行,以及云上应用能否用收入证明算力需求。
真正值得追问的问题不是“模型参数有多大”,而是这项计划能否沿着芯片、互联、服务器、数据中心和云服务逐层传导,最终形成可持续的商业需求。
阿里CEO吴泳铭已经给出了“AI模型、AI芯片、AI云”三大基石的框架。公开披露的信息还显示,阿里云计划到2032年运营的全球数据中心规模超过20GW,较2022年增长10倍。20GW是长期目标,不是已经建成的容量,也不能直接等同于近期订单或当前电力消耗。阿里押注的,实际上是一场从模型能力到基础设施供给的系统工程。
一、超大模型为何会抬高基础设施需求
训练和推理是两种不同的算力生意。
训练超大模型,需要大规模集群在较长时间内持续运行,核心约束集中在芯片数量、显存容量、片间通信、数据吞吐和集群稳定性。模型训练完成后,推理需求又会以另一种方式出现:用户调用、企业部署和智能体执行任务,都需要持续占用算力。尤其是长程任务和智能体应用,可能不是一次问答就结束,而是持续规划、调用工具、读取数据并反复修正,推理资源因此更接近长期在线的供给能力。
但参数量并不是算力需求的唯一决定因素。模型架构、训练数据规模、精度、并行方式、是否采用稀疏计算,以及最终调用频率,都会改变实际算力消耗。5万亿至10万亿参数首先是能力和工程目标,不能直接换算成芯片采购量、服务器数量或数据中心功率。
阿里在云栖大会披露,递归自我改进技术已初步进入模型训练、推理及芯模协同环节,Qwen4正在训练。若这类技术进一步用于模型研发和软硬件协同,算力需求的增长可能不只来自一次性训练,也来自持续迭代、评测和推理服务。
二、第一层传导:芯片竞争从单卡指标走向集群效率
真武V900是观察阿里芯片布局的一个窗口。按公开披露信息,该芯片算力为上一代M890的3倍,配备216GB显存,片间互联带宽达到1200GB/s,单集群可扩展至50万卡,并计划于2027年第一季度量产。
这些指标对超大模型的重要性,并不只在于“算力更高”。参数规模扩大后,模型状态、训练数据和中间结果需要在更大范围内被存取和交换。显存容量影响单卡能够承载的工作量,片间互联影响通信等待,集群扩展能力则决定系统能否从小规模验证走向大规模部署。
平头哥目前还被披露已布局真武系列GPU、倚天系列CPU、磐脉系列智能网卡和ICN互联芯片。芯片、网卡、互联和云平台若能协同设计,阿里可以尝试降低系统适配成本,并改善自研芯片的供给保障能力。
然而,纸面性能不等于实际集群效率。超大集群还要面对软件栈适配、通信调度、故障隔离、任务恢复和不同工作负载的利用率问题。V900的量产时间、实际商用规模、客户部署情况和运行效率,公开信息尚不足以确认。将芯片披露参数直接等同于完整国产替代能力,也缺乏足够依据。
三、第二层传导:算力中心不只是服务器采购
如果说芯片负责生成Token,数据中心就是把Token输送到用户和企业的网络。超大模型训练带来的需求,会继续传导至服务器整机、高速网络、存储系统、供电、制冷、土地和工程交付。
数据中心以GW计量,本身就说明竞争不再局限于单一硬件。大规模集群需要稳定电力、适配高密度算力的制冷系统、足够的网络带宽和持续运维能力。集群越大,交付周期(883436)、故障管理和系统稳定性越可能成为决定可用产能的关键因素。
阿里提出到2032年全球数据中心规模超过20GW,说明其长期目标已从“采购算力”延伸至“组织算力供给”。但20GW究竟对应运营规模、装机容量,还是其他数据中心容量口径,仍需进一步明确。报道提到阿里此前有3800亿元三年投入计划,这类投入计划也不能直接与20GW目标、当期资本开支或已签订单画等号,最终仍应以公司财报和项目投产信息验证。
因此,产业链判断不能停留在“数据中心扩张会带来设备需求”。只有当项目取得电力、土地和网络条件,设备完成交付,集群正式上线并产生收入,长期规划才会转化为现实产能。
四、第三层传导:云服务能否承接新增供给
基础设施投资的终点,不是机房亮灯,而是云平台能够以可接受的价格持续提供模型服务。
阿里云已经展示了多类AI应用,包括依托千问大模型的智能近视管理眼镜、金融AI终端和企业数字员工。云上超节点和模型服务如果能够规模化供给,超大模型就有机会通过API调用、企业订阅和行业部署消化推理资源。
商业化仍取决于三个变量:API价格能否覆盖推理成本,企业是否愿意把高频业务迁移到云端,以及应用能否形成稳定调用量。模型降本会扩大使用范围,却也可能压低单次调用价格。若应用增长速度低于算力供给扩张速度,数据中心和集群利用率就可能承压。
智能体的扩张还会带来另一类需求。机构观点认为,AI安全治理将延伸至数据、模型、软件、算力和平台等供应链环节,身份权限管理、数据安全(885942)、可信追溯和预警机制可能成为企业级部署的基础设施。也就是说,超大模型的产业影响不只体现在算力设备,还会推动安全、运维和治理能力进入交付清单。
五、比订单更重要的五个观察指标
第一,看数据中心实际投产进度,而不是只看2032年目标。第二,看真武V900是否按计划量产,以及是否出现可验证的客户部署和稳定运行记录。第三,看集群利用率、单位推理成本和长程任务的服务效率,这些指标比峰值算力更接近商业价值。第四,看阿里云相关收入和资本开支是否兑现,区分规划、投入、产能、订单和收入五个层次。第五,看开发者与企业客户能否持续留存,应用调用是否从展示性案例转为高频生产需求。
阿里训练5万亿至10万亿参数模型,可能推动AI产业链从“买芯片”走向“建系统”:芯片、互联、服务器、数据中心、电力、云服务和安全治理被纳入同一条传导链。但这条链条并非每一环都会同步受益,也不存在从模型参数直接推导订单的简单公式。
市场当前交易的更多是长期基础设施预期。真正决定产业景气成色的,将是模型训练能否落地、芯片能否量产、集群能否高效运行,以及云上应用能否用收入证明算力需求。
