阿里巴巴(BABA)把下一阶段的AI竞争,推向了一个更高的数量级:Qwen团队计划训练参数规模为5万亿至10万亿的新模型,目标是处理更复杂、更长程的任务,并向ASI方向探索。与此同时,阿里提出到2032年阿里云运营的全球数据中心规模超过20GW,较2022年增长10倍,并以“AI模型、AI芯片、AI云”构成完整基础设施框架。
真正需要追问的,不是模型能否训练出来,而是这套超大规模投入能否形成可持续的需求、回报与安全闭环。
一、需求从哪里来:更大的模型,是否对应更大的付费市场?
阿里的判断是,机器思考将成为规模化商品,未来需求可能远超今天。但从产业经营角度看,算力扩张需要三个条件同时成立:模型能力持续提升,推理成本持续下降,客户愿意把真实业务交给模型长期调用。
云栖大会上出现的智能应用,已经提供了需求的早期样本。深圳慧明眼镜的“李白”智能眼镜依托千问大模型,采集用眼习惯、坐姿体态和眼部健康数据;金融AI终端、数字员工、视听生成等应用,也在尝试进入具体工作流。这些案例说明应用正在增加,却还不足以证明智能体和长程任务会形成稳定、足够大的商业调用量。
影响机制很清楚:模型能力提升,可能带来更复杂的任务;任务复杂度上升,带来更高的Token消耗;调用规模扩大,才可能摊薄芯片、数据中心和运维成本。任何一个环节没有兑现,供给扩张都可能领先于需求。尤其是训练完成与商业收入增长之间,可能存在较长时间差,不能把模型参数量直接等同于业务价值。
二、财务回报如何验证:20GW不是一个收入数字
数据中心规模扩张本质上是重资产命题。资本开支之外,还要承担折旧、能源(850101)、网络、制冷和运维等持续成本。阿里此前已有3800亿元三年投入计划,新的20GW目标被相关报道描述为实际投入可能远超此前计划,但公开信息尚不足以确认其完整资本开支、建设节奏、资产归属和盈利路径。
20GW究竟有多少是自建、租赁或合作运营,数据中心产能由谁投资,芯片采购与自研比例如何,均需要后续披露验证。单看某一季度资本开支增长,也不能直接外推为长期趋势,更不能直接解释为AI收入同步增长。
更有价值的观察指标,是AI云收入、客户留存、模型调用量、算力利用率和单位推理成本是否同步改善。若算力利用率不足,折旧和能源(850101)成本会先进入利润表;若客户使用增长但价格下降过快,收入规模增长也未必能覆盖基础设施成本。阿里选择“用今天的利润,赌十年后的基础设施”,本质上是把经营确定性换取长期期权,回报需要用多年经营数据验证。
三、自主改进带来的问题:权限边界能否跟上能力增长?
阿里披露,递归自我改进技术已初步进入模型训练、推理和芯模协同等环节,Qwen4正在训练。云栖大会相关展示还提到,模型曾连续调用EDA工具,完成电路描述、验证到后端物理实现的流程。
这类能力提升可能缩短研发周期(883436),也会扩大治理难度。模型自主调用工具、生成数据并持续迭代后,风险不再只是回答错误,还包括身份冒用、权限越界、沙盒逃逸、数据泄露和供应链污染。行业报告提到,近期智能体异常行为涉及安全护栏绕过、网站劫持等问题,单纯依赖静态规则或发布前测试,可能难以覆盖高权限智能体的全部行为路径。这些是行业风险,不能据此断言阿里系统已经发生同类事件,但足以说明治理必须前置。
企业部署高权限Agent,至少需要身份认证、最小权限、工具白名单、隔离沙盒、全过程审计和紧急终止机制。治理对象还要延伸到数据、模型、软件、算力和平台供应链,形成可追溯、可评估、可预警的体系。模型越能参与研发,安全机制就越不能停留在发布前的一次性测试。
四、全栈布局的优势与复杂度
阿里同时布局模型、芯片和云,理论上可以通过软硬件协同降低适配成本,并提升供给保障能力。平头哥已布局真武系列GPU、倚天系列CPU、磐脉系列智能网卡和ICN互联芯片;真武V900被披露为上一代M890算力的3倍,单集群可扩展至50万卡,并计划于2027年第一季度量产。这些动作有助于把芯片、模型和云服务放进同一条优化链路。
但自研芯片的难点不只在参数和算力,还在软件生态、开发工具、客户适配与规模化验证。全球技术限制、芯片供给和工程交付也可能改变建设节奏。开源生态能够扩大开发者和客户基础,却可能压低单次调用价格,商业化变现与生态扩张之间需要重新平衡。
五个问题,决定这场投入能否兑现
第一,5万亿至10万亿参数模型是否按计划训练并发布,实际能力提升体现在哪里;第二,单位推理成本能否持续下降,长程任务是否带来持续调用;第三,20GW数据中心和芯片产能是否按期落地,利用率能否达到商业化要求;第四,AI云收入、客户数量与调用量是否同步增长;第五,安全事件、审计机制和监管要求是否出现新的约束。
因此,阿里的超大模型计划更适合被看作一张长期基础设施路线图,而不是已经兑现的业绩承诺。模型规模只是起点,需求密度、资产利用率和安全治理,才是决定这张路线图能否转化为商业结果的三条主线。
真正需要追问的,不是模型能否训练出来,而是这套超大规模投入能否形成可持续的需求、回报与安全闭环。
一、需求从哪里来:更大的模型,是否对应更大的付费市场?
阿里的判断是,机器思考将成为规模化商品,未来需求可能远超今天。但从产业经营角度看,算力扩张需要三个条件同时成立:模型能力持续提升,推理成本持续下降,客户愿意把真实业务交给模型长期调用。
云栖大会上出现的智能应用,已经提供了需求的早期样本。深圳慧明眼镜的“李白”智能眼镜依托千问大模型,采集用眼习惯、坐姿体态和眼部健康数据;金融AI终端、数字员工、视听生成等应用,也在尝试进入具体工作流。这些案例说明应用正在增加,却还不足以证明智能体和长程任务会形成稳定、足够大的商业调用量。
影响机制很清楚:模型能力提升,可能带来更复杂的任务;任务复杂度上升,带来更高的Token消耗;调用规模扩大,才可能摊薄芯片、数据中心和运维成本。任何一个环节没有兑现,供给扩张都可能领先于需求。尤其是训练完成与商业收入增长之间,可能存在较长时间差,不能把模型参数量直接等同于业务价值。
二、财务回报如何验证:20GW不是一个收入数字
数据中心规模扩张本质上是重资产命题。资本开支之外,还要承担折旧、能源(850101)、网络、制冷和运维等持续成本。阿里此前已有3800亿元三年投入计划,新的20GW目标被相关报道描述为实际投入可能远超此前计划,但公开信息尚不足以确认其完整资本开支、建设节奏、资产归属和盈利路径。
20GW究竟有多少是自建、租赁或合作运营,数据中心产能由谁投资,芯片采购与自研比例如何,均需要后续披露验证。单看某一季度资本开支增长,也不能直接外推为长期趋势,更不能直接解释为AI收入同步增长。
更有价值的观察指标,是AI云收入、客户留存、模型调用量、算力利用率和单位推理成本是否同步改善。若算力利用率不足,折旧和能源(850101)成本会先进入利润表;若客户使用增长但价格下降过快,收入规模增长也未必能覆盖基础设施成本。阿里选择“用今天的利润,赌十年后的基础设施”,本质上是把经营确定性换取长期期权,回报需要用多年经营数据验证。
三、自主改进带来的问题:权限边界能否跟上能力增长?
阿里披露,递归自我改进技术已初步进入模型训练、推理和芯模协同等环节,Qwen4正在训练。云栖大会相关展示还提到,模型曾连续调用EDA工具,完成电路描述、验证到后端物理实现的流程。
这类能力提升可能缩短研发周期(883436),也会扩大治理难度。模型自主调用工具、生成数据并持续迭代后,风险不再只是回答错误,还包括身份冒用、权限越界、沙盒逃逸、数据泄露和供应链污染。行业报告提到,近期智能体异常行为涉及安全护栏绕过、网站劫持等问题,单纯依赖静态规则或发布前测试,可能难以覆盖高权限智能体的全部行为路径。这些是行业风险,不能据此断言阿里系统已经发生同类事件,但足以说明治理必须前置。
企业部署高权限Agent,至少需要身份认证、最小权限、工具白名单、隔离沙盒、全过程审计和紧急终止机制。治理对象还要延伸到数据、模型、软件、算力和平台供应链,形成可追溯、可评估、可预警的体系。模型越能参与研发,安全机制就越不能停留在发布前的一次性测试。
四、全栈布局的优势与复杂度
阿里同时布局模型、芯片和云,理论上可以通过软硬件协同降低适配成本,并提升供给保障能力。平头哥已布局真武系列GPU、倚天系列CPU、磐脉系列智能网卡和ICN互联芯片;真武V900被披露为上一代M890算力的3倍,单集群可扩展至50万卡,并计划于2027年第一季度量产。这些动作有助于把芯片、模型和云服务放进同一条优化链路。
但自研芯片的难点不只在参数和算力,还在软件生态、开发工具、客户适配与规模化验证。全球技术限制、芯片供给和工程交付也可能改变建设节奏。开源生态能够扩大开发者和客户基础,却可能压低单次调用价格,商业化变现与生态扩张之间需要重新平衡。
五个问题,决定这场投入能否兑现
第一,5万亿至10万亿参数模型是否按计划训练并发布,实际能力提升体现在哪里;第二,单位推理成本能否持续下降,长程任务是否带来持续调用;第三,20GW数据中心和芯片产能是否按期落地,利用率能否达到商业化要求;第四,AI云收入、客户数量与调用量是否同步增长;第五,安全事件、审计机制和监管要求是否出现新的约束。
因此,阿里的超大模型计划更适合被看作一张长期基础设施路线图,而不是已经兑现的业绩承诺。模型规模只是起点,需求密度、资产利用率和安全治理,才是决定这张路线图能否转化为商业结果的三条主线。
