阿里把下一阶段的大模型目标,直接推到了5万亿至10万亿参数。
在云栖大会上,阿里巴巴(BABA)CEO吴泳铭表示,Qwen团队正在推进模型架构和数据优化研究,计划训练5—10T参数规模的新模型,目标是完成更复杂、更长程的任务,向人工超智能迈进。
先要厘清一个容易被忽略的事实:这是一项后续版本的规划目标,不是已经完成、也不是已经确定交付的模型。参数量是模型规模的一个指标,不能直接等同于智能水平。模型最终表现还取决于训练数据质量、训练方法、架构设计、推理策略以及在真实任务中的稳定性。
但5万亿至10万亿参数仍然是一个足以改变工程边界的数字。参数规模扩大,首先会把压力传导至显存、存储、网络互联和集群调度。训练阶段需要处理更大规模的参数、梯度和中间状态;推理阶段则要面对模型加载、并发请求和响应时延。模型能不能做出来是一回事,能不能在可接受的成本和时间内训练完成、部署上线并持续服务,是另一回事。
可能的收益也不能简单概括为“参数越多,能力越强”。更大的模型有机会承载更复杂的知识关系和更长程的任务规划,但收益取决于新增参数是否被有效训练。若数据、算法和系统效率没有同步改善,规模扩张可能只是成本曲线的上移。
阿里正在用芯片和云基础设施,为这一目标预留路线。平头哥发布的真武V900,被披露为上一代真武M890算力的3倍,配备216GB显存,片间互联带宽达到1200GB/s,单集群可扩展至50万卡,计划于2027年第一季度量产。这里的关键词不是单颗芯片的纸面参数,而是芯片、互联、软件和集群能否协同工作。
M890已经被阿里披露用于支撑超过2万亿参数模型的高效推理。这个表述对应的是推理支持能力,不应被解读为已经完成了同等规模模型的训练。训练与推理对系统的要求不同:前者更强调大规模并行、通信效率和长时间稳定运行,后者更关注显存占用、吞吐、时延与单位Token成本。
V900的意义也不只是替代某一款外部芯片。阿里披露的平头哥布局还包括倚天系列CPU、磐脉系列智能网卡和ICN互联芯片。芯片负责计算,网卡和互联决定数据如何流动,云平台则负责把这些资源调度给训练和推理任务。只看芯片算力,容易忽略通信瓶颈、故障率、软件适配和资源利用率对实际产出的影响。
阿里为AI基础设施设定的长期刻度同样激进:到2032年,阿里云运营的全球数据中心规模超过20GW,较2022年增长10倍。这个目标显示,阿里押注的不是一次模型发布,而是模型、芯片和云的长期绑定。但数据中心规模扩大并不自动等于有效算力增加,电力供应、机房建设、存储网络和客户需求都需要同步兑现。
更隐蔽的瓶颈在软件层。云栖大会披露的案例显示,Qwen3.8-Max曾自主调用EDA工具,在60多个小时内完成从编写电路描述、验证到后端物理实现的流程;相关模型还被用于适配和优化推理框架。这些案例说明,模型有望成为芯片设计和软件工程的工具,帮助降低部分研发环节的试错成本。
但阶段性技术展示不能推导出超大模型已经具备自主研发能力。公开信息尚不足以确认上述实验的具体条件、人工介入程度、结果质量和可重复性,更不能据此证明5万亿至10万亿参数模型必然能够自我改进。真正的挑战,是把一次演示变成稳定、可审计、可复用的研发闭环。
这也是阿里计划对AI产业生态最可能产生的影响:竞争将从单纯比拼模型榜单,转向比拼系统效率和供给能力。芯片厂商需要关注显存、互联和软件栈;云厂商需要提供更稳定的训练资源和推理服务;存储、网络、数据中心以及能源(850101)配套都可能受益于算力扩张。国家统计局公布的1—8月份数据已经显示,电子行业利润同比增长1.1倍,对规上工业企业利润增长贡献率达62%;光电子器件制造、半导体(881121)分立器件(884090)制造利润分别增长72.0%和51.8%。这类产业数据能够说明需求正在传导,但不能直接证明某一家公司的超大模型计划已经商业化。
企业客户最终也不会为参数数量本身买单。阿里云副总裁霍嘉曾将企业AI项目失败归因于找错场景、高估数据质量,以及沿用传统信息化项目的做法。大模型只有在长程任务完成率、调用成本、响应速度和业务结果上形成优势,才可能转化为持续Token需求和云收入。参数规模与商业价值之间,还隔着一整套工程验证。
判断这项计划能否落地,后续至少要看四组信号:第一,训练是否真正启动,模型架构、数据策略和训练阶段是否披露;第二,训练集群规模、V900量产进度以及云端供给能力能否兑现;第三,模型在长程任务、推理成本和真实客户中的表现,是否超越更小模型的性价比;第四,是否形成稳定的开发者、企业客户和工具链生态。
所以,5万亿至10万亿参数更像一张工程路线图,而不是能力成绩单。阿里已经给出了模型、芯片和云的组合方案,也披露了M890、V900及20GW数据中心等支撑目标。接下来市场真正要验证的,不是数字还能不能继续变大,而是这套系统能否把参数转化为可持续、可负担、可复用的智能服务。
在云栖大会上,阿里巴巴(BABA)CEO吴泳铭表示,Qwen团队正在推进模型架构和数据优化研究,计划训练5—10T参数规模的新模型,目标是完成更复杂、更长程的任务,向人工超智能迈进。
先要厘清一个容易被忽略的事实:这是一项后续版本的规划目标,不是已经完成、也不是已经确定交付的模型。参数量是模型规模的一个指标,不能直接等同于智能水平。模型最终表现还取决于训练数据质量、训练方法、架构设计、推理策略以及在真实任务中的稳定性。
但5万亿至10万亿参数仍然是一个足以改变工程边界的数字。参数规模扩大,首先会把压力传导至显存、存储、网络互联和集群调度。训练阶段需要处理更大规模的参数、梯度和中间状态;推理阶段则要面对模型加载、并发请求和响应时延。模型能不能做出来是一回事,能不能在可接受的成本和时间内训练完成、部署上线并持续服务,是另一回事。
可能的收益也不能简单概括为“参数越多,能力越强”。更大的模型有机会承载更复杂的知识关系和更长程的任务规划,但收益取决于新增参数是否被有效训练。若数据、算法和系统效率没有同步改善,规模扩张可能只是成本曲线的上移。
阿里正在用芯片和云基础设施,为这一目标预留路线。平头哥发布的真武V900,被披露为上一代真武M890算力的3倍,配备216GB显存,片间互联带宽达到1200GB/s,单集群可扩展至50万卡,计划于2027年第一季度量产。这里的关键词不是单颗芯片的纸面参数,而是芯片、互联、软件和集群能否协同工作。
M890已经被阿里披露用于支撑超过2万亿参数模型的高效推理。这个表述对应的是推理支持能力,不应被解读为已经完成了同等规模模型的训练。训练与推理对系统的要求不同:前者更强调大规模并行、通信效率和长时间稳定运行,后者更关注显存占用、吞吐、时延与单位Token成本。
V900的意义也不只是替代某一款外部芯片。阿里披露的平头哥布局还包括倚天系列CPU、磐脉系列智能网卡和ICN互联芯片。芯片负责计算,网卡和互联决定数据如何流动,云平台则负责把这些资源调度给训练和推理任务。只看芯片算力,容易忽略通信瓶颈、故障率、软件适配和资源利用率对实际产出的影响。
阿里为AI基础设施设定的长期刻度同样激进:到2032年,阿里云运营的全球数据中心规模超过20GW,较2022年增长10倍。这个目标显示,阿里押注的不是一次模型发布,而是模型、芯片和云的长期绑定。但数据中心规模扩大并不自动等于有效算力增加,电力供应、机房建设、存储网络和客户需求都需要同步兑现。
更隐蔽的瓶颈在软件层。云栖大会披露的案例显示,Qwen3.8-Max曾自主调用EDA工具,在60多个小时内完成从编写电路描述、验证到后端物理实现的流程;相关模型还被用于适配和优化推理框架。这些案例说明,模型有望成为芯片设计和软件工程的工具,帮助降低部分研发环节的试错成本。
但阶段性技术展示不能推导出超大模型已经具备自主研发能力。公开信息尚不足以确认上述实验的具体条件、人工介入程度、结果质量和可重复性,更不能据此证明5万亿至10万亿参数模型必然能够自我改进。真正的挑战,是把一次演示变成稳定、可审计、可复用的研发闭环。
这也是阿里计划对AI产业生态最可能产生的影响:竞争将从单纯比拼模型榜单,转向比拼系统效率和供给能力。芯片厂商需要关注显存、互联和软件栈;云厂商需要提供更稳定的训练资源和推理服务;存储、网络、数据中心以及能源(850101)配套都可能受益于算力扩张。国家统计局公布的1—8月份数据已经显示,电子行业利润同比增长1.1倍,对规上工业企业利润增长贡献率达62%;光电子器件制造、半导体(881121)分立器件(884090)制造利润分别增长72.0%和51.8%。这类产业数据能够说明需求正在传导,但不能直接证明某一家公司的超大模型计划已经商业化。
企业客户最终也不会为参数数量本身买单。阿里云副总裁霍嘉曾将企业AI项目失败归因于找错场景、高估数据质量,以及沿用传统信息化项目的做法。大模型只有在长程任务完成率、调用成本、响应速度和业务结果上形成优势,才可能转化为持续Token需求和云收入。参数规模与商业价值之间,还隔着一整套工程验证。
判断这项计划能否落地,后续至少要看四组信号:第一,训练是否真正启动,模型架构、数据策略和训练阶段是否披露;第二,训练集群规模、V900量产进度以及云端供给能力能否兑现;第三,模型在长程任务、推理成本和真实客户中的表现,是否超越更小模型的性价比;第四,是否形成稳定的开发者、企业客户和工具链生态。
所以,5万亿至10万亿参数更像一张工程路线图,而不是能力成绩单。阿里已经给出了模型、芯片和云的组合方案,也披露了M890、V900及20GW数据中心等支撑目标。接下来市场真正要验证的,不是数字还能不能继续变大,而是这套系统能否把参数转化为可持续、可负担、可复用的智能服务。
