9月29日,OpenAI在年度开发者大会上把竞争焦点从“模型能否回答问题”推进到“能否持续完成任务”。公司推出个人智能体Dots,并发布GPT-6.1 Sol模型,前者对标Meta(META)近期上线的Muse,后者则试图在模型能力与调用成本之间寻找新的平衡。
公开报道显示,Dots被定位为可持续运行的个人智能体,依托GPT-6 Astra驱动,并拥有独立的云端电脑。用户可以通过ChatGPT桌面端、网页端和手机App与其交互,也可以在Slack、微软(MSFT)Teams等办公工具中跟进任务。相关报道提及,Dots能够连接4000多个应用,执行网页浏览、代码编写与测试等工作,并根据反馈调整执行方式。
OpenAI首席执行官山姆·奥特曼举例称,用户可以把持续跟踪软件缺陷、测试修复方案、提交代码审查,或推进年度预算编制等工作交给Dots。以旧API迁移为例,智能体需要识别代码库中的调用关系,完成修改和测试,再交由团队审核。由此看,Dots的产品形态已经不再局限于一次问答,而是承接目标、拆解步骤、调用工具并推进结果。
Dots的具体开放范围、任务完成率以及长期运行边界,目前仍主要来自公开报道,OpenAI官方公告、正式定价和更多运行细节仍有待进一步披露。市场真正关心的,也不只是它能否成为新的流量入口,而是智能体是否会逐步进入互联网服务的执行层。现阶段,入口迁移能否成立尚未得到充分验证,但围绕执行能力的竞争已经展开。
Meta(META)的Muse已经提供了一个市场参照。相关报道显示,Muse在北美上线12天后约获得280万次下载,日活约64.2万;从9月8日发布到9月29日收盘,Meta(META)股价累计上涨超过20%,市值增加逾2000亿美元。摩根大通(JPM)称其为“ChatGPT以来最快找到产品市场契合的消费(883434)级AI应用”。这些数据可以说明产品获得了市场关注,但尚不足以证明长期留存和稳定付费能力。
OpenAI同步发布GPT-6.1 Sol,则把竞争拉回模型调用的经济账。公开信息显示,Sol主打性能与成本平衡,在智能体编程、电脑操作和专业工作等方面的表现被描述为接近Astra;其标准输入、输出价格为Astra的五分之一。另有信息显示,GPT-6.1 Sol标准API价格为每百万词元输入2美元、输出10美元,缓存输入价格为0.10美元,较前代GPT-6 Sol降低一半。相关性能和价格关系仍应以OpenAI后续正式披露为准。
价格下降的价值,不只是降低单次调用账单。智能体任务通常包含规划、检索、浏览、工具调用、结果检查和重新规划等环节,同一任务可能反复调用模型。输入Token、输出Token、缓存读取效率和推理速度,都会影响最终完成一项工作的成本。当模型能力逐步接近,单位任务成本可能比单次榜单成绩更能决定产品能否大规模使用。
智能体的基础设施需求也因此变得更加复杂。一项后台运行的任务需要持续占用计算、存储和网络资源;它还可能访问文件、浏览器、企业软件和数据库。GPU或其他加速器承担模型推理,CPU更多负责虚拟机管理、任务调度、数据预处理和工具执行,内存与企业级存储则承接运行中的任务、文件、日志及持久化状态。用户关闭界面,并不代表云端任务立即停止。
多轮智能体工作流还会放大通信时延。模型规模越大、上下文越长,芯片之间交换的模型权重、中间结果和KV Cache越多;互联速度不足时,计算芯片会把更多时间花在等待数据上。一次任务增加几十毫秒,经过多轮循环后,最终用户体验可能明显变慢。因此,AI基础设施竞争已经从单颗芯片性能,延伸至显存、内存、网络、散热、算子和软件调度的协同。
浪潮信息(000977)近期发布的元脑SD200 Ultra,正是这一系统化方向的案例。公司称,该超节点AI服务器连接128颗本土AI芯片,配备8TB统一编址显存和64TB内存,面向万亿参数模型及复杂智能体任务。其通信时延最低为0.69微秒,内部测试显示AllReduce通信时间缩短至原来的约三分之一。
浪潮信息(000977)还公布了该系统运行Kimi K3的测试结果:单个超节点可以承载这一总参数量2.8万亿、激活参数1040亿、上下文长度达100万Token的模型,Token生成时延最低为5.85毫秒,对应单用户每秒生成约170个Token。公司同时称,通过合并KDA、Gated MLA和MoE部分基础算子,算子数量减少约90%,模型推理性能提升3倍以上。上述数据属于企业测试口径,实际效果仍取决于模型、软件和部署环境。
超节点的核心并不是简单增加芯片数量,而是把分散的芯片、显存和内存组织成一个高效协作的计算域。芯片数量扩大后,通信量、调度复杂度、功耗和故障点也会同步增加,新增硬件带来的收益可能被通信等待和可靠性成本抵消。对需要长时间运行的智能体来说,一次通信中断甚至可能影响整条任务链。
Dots与GPT-6.1 Sol释放出的信号由此变得清晰:AI应用正在从“提供答案”走向“交付结果”,模型厂商需要同时解决能力、价格、持续运行和安全边界问题。智能体能否成为新的消费(883434)入口仍需市场验证,但围绕单位任务成本、云端执行环境和系统级算力的竞争,已经成为下一阶段的重要战场。
公开报道显示,Dots被定位为可持续运行的个人智能体,依托GPT-6 Astra驱动,并拥有独立的云端电脑。用户可以通过ChatGPT桌面端、网页端和手机App与其交互,也可以在Slack、微软(MSFT)Teams等办公工具中跟进任务。相关报道提及,Dots能够连接4000多个应用,执行网页浏览、代码编写与测试等工作,并根据反馈调整执行方式。
OpenAI首席执行官山姆·奥特曼举例称,用户可以把持续跟踪软件缺陷、测试修复方案、提交代码审查,或推进年度预算编制等工作交给Dots。以旧API迁移为例,智能体需要识别代码库中的调用关系,完成修改和测试,再交由团队审核。由此看,Dots的产品形态已经不再局限于一次问答,而是承接目标、拆解步骤、调用工具并推进结果。
Dots的具体开放范围、任务完成率以及长期运行边界,目前仍主要来自公开报道,OpenAI官方公告、正式定价和更多运行细节仍有待进一步披露。市场真正关心的,也不只是它能否成为新的流量入口,而是智能体是否会逐步进入互联网服务的执行层。现阶段,入口迁移能否成立尚未得到充分验证,但围绕执行能力的竞争已经展开。
Meta(META)的Muse已经提供了一个市场参照。相关报道显示,Muse在北美上线12天后约获得280万次下载,日活约64.2万;从9月8日发布到9月29日收盘,Meta(META)股价累计上涨超过20%,市值增加逾2000亿美元。摩根大通(JPM)称其为“ChatGPT以来最快找到产品市场契合的消费(883434)级AI应用”。这些数据可以说明产品获得了市场关注,但尚不足以证明长期留存和稳定付费能力。
OpenAI同步发布GPT-6.1 Sol,则把竞争拉回模型调用的经济账。公开信息显示,Sol主打性能与成本平衡,在智能体编程、电脑操作和专业工作等方面的表现被描述为接近Astra;其标准输入、输出价格为Astra的五分之一。另有信息显示,GPT-6.1 Sol标准API价格为每百万词元输入2美元、输出10美元,缓存输入价格为0.10美元,较前代GPT-6 Sol降低一半。相关性能和价格关系仍应以OpenAI后续正式披露为准。
价格下降的价值,不只是降低单次调用账单。智能体任务通常包含规划、检索、浏览、工具调用、结果检查和重新规划等环节,同一任务可能反复调用模型。输入Token、输出Token、缓存读取效率和推理速度,都会影响最终完成一项工作的成本。当模型能力逐步接近,单位任务成本可能比单次榜单成绩更能决定产品能否大规模使用。
智能体的基础设施需求也因此变得更加复杂。一项后台运行的任务需要持续占用计算、存储和网络资源;它还可能访问文件、浏览器、企业软件和数据库。GPU或其他加速器承担模型推理,CPU更多负责虚拟机管理、任务调度、数据预处理和工具执行,内存与企业级存储则承接运行中的任务、文件、日志及持久化状态。用户关闭界面,并不代表云端任务立即停止。
多轮智能体工作流还会放大通信时延。模型规模越大、上下文越长,芯片之间交换的模型权重、中间结果和KV Cache越多;互联速度不足时,计算芯片会把更多时间花在等待数据上。一次任务增加几十毫秒,经过多轮循环后,最终用户体验可能明显变慢。因此,AI基础设施竞争已经从单颗芯片性能,延伸至显存、内存、网络、散热、算子和软件调度的协同。
浪潮信息(000977)近期发布的元脑SD200 Ultra,正是这一系统化方向的案例。公司称,该超节点AI服务器连接128颗本土AI芯片,配备8TB统一编址显存和64TB内存,面向万亿参数模型及复杂智能体任务。其通信时延最低为0.69微秒,内部测试显示AllReduce通信时间缩短至原来的约三分之一。
浪潮信息(000977)还公布了该系统运行Kimi K3的测试结果:单个超节点可以承载这一总参数量2.8万亿、激活参数1040亿、上下文长度达100万Token的模型,Token生成时延最低为5.85毫秒,对应单用户每秒生成约170个Token。公司同时称,通过合并KDA、Gated MLA和MoE部分基础算子,算子数量减少约90%,模型推理性能提升3倍以上。上述数据属于企业测试口径,实际效果仍取决于模型、软件和部署环境。
超节点的核心并不是简单增加芯片数量,而是把分散的芯片、显存和内存组织成一个高效协作的计算域。芯片数量扩大后,通信量、调度复杂度、功耗和故障点也会同步增加,新增硬件带来的收益可能被通信等待和可靠性成本抵消。对需要长时间运行的智能体来说,一次通信中断甚至可能影响整条任务链。
Dots与GPT-6.1 Sol释放出的信号由此变得清晰:AI应用正在从“提供答案”走向“交付结果”,模型厂商需要同时解决能力、价格、持续运行和安全边界问题。智能体能否成为新的消费(883434)入口仍需市场验证,但围绕单位任务成本、云端执行环境和系统级算力的竞争,已经成为下一阶段的重要战场。
