“全天候自主智能体Dots”正在市场传播,GPT-6.1 Sol“性能接近Astra、标准词元价格只有五分之一”的说法,也被反复提及。消息足够吸引眼球,但截至目前,公开信息尚不足以确认Dots已经作为OpenAI正式产品推出,也无法完整核实其产品形态、运行方式和可用范围。
GPT-6.1 Sol的情况同样需要拆开看。现有资料尚未证明这是否是正式模型名称,也没有看到与Astra之间完整、可复现的性能对比。“五分之一”究竟对应输入Token、输出Token,还是某一档促销价格,公开信息也没有给出明确口径。因此,这组数字暂时不能直接用于判断两家公司的模型成本差距,更不能据此推算产业链需求。
能够确认的行业变化,是模型产品正在加速分层,API价格竞争也在继续。此前公开资料显示,OpenAI的GPT-6 Sol和GPT-6 Luna API价格,相比GPT-5.6此前的促销价格下降50%。今年夏天,OpenAI还通过Sol、Terra和Luna等不同能力层级的模型,让客户按照任务复杂度和预算进行选择。市场关注的重点,已经从“谁的模型能力最高”,逐渐转向“哪些任务没有必要调用最贵的模型”。
Anthropic在10月7日推出Claude Haiku 5.5,正是这一竞争方向的一个明确信号。该公司称,这是其速度最快、能力最强、价格最低的小模型。Haiku 5.5最低输入价格为每百万Token 0.1美元,较上一代下降90%,主要面向高频调用、成本敏感且任务边界相对清晰的应用。
Anthropic公布的测试结果显示,Haiku 5.5在部分Agent和知识工作基准上超过GPT-6 Luna。在OSWorld 2.1离线任务子集中,Haiku 5.5成功率为72.4%,Haiku 4.5为15.7%,GPT-6 Luna为48.9%;GDPval-AA v2.1测试中,Haiku 5.5得分1620,GPT-6 Luna为1437;Terminal-Bench 4.0中,两者成绩分别为39.2%和16.4%。这些数据来自厂商公布的测试,不能简单等同于所有真实业务场景下的表现。
推理强度还会改变性能与成本的平衡。Haiku 5.5允许开发者通过effort参数调整计算投入,Anthropic披露的Terminal-Bench成绩中,39.2%对应最高推理强度;切换到中等强度后,成绩约为20%,而中等强度是默认设置。Artificial Analysis的评测也显示,最高推理强度与中等强度下,模型得分分别为43分和34分,平均单项任务成本约为0.21美元和0.05美元。
这组数据提示企业,API单价并不是完整账单。任务成功率、重复调用次数、上下文长度和推理预算,都会影响最终成本。Haiku 5.5更适合摘要、分类、数据库查询、上下文压缩,以及在复杂Agent流程中承担Subagent,而更复杂的Agent编程任务仍更适合Sonnet和Opus等更高能力模型。
企业侧的反馈也在强化“小模型承担执行环节”的趋势。金融AI公司Rogo曾让小模型进入企业10-K年报,提取业务收入数据,再交由更强模型制作财务演示文稿。AlphaSense的Ask in Document功能每周约处理800万次调用,主要回答围绕文档的具体问题。其披露的400个测试查询中,Haiku 5.5得分0.84,Haiku 4.5为0.76。Box(BOX)则称,Haiku 5.5相较上一代内部评测提高11分、延迟下降约50%,但其完整评测标准并未公开。
企业采购数据也显示,模型厂商之间的竞争正在从单点能力扩展到价格、速度和调用规模。OpenRouter对约12万家使用Anthropic和OpenAI工具的企业进行的分析称,9月份两家公司获得的支出份额大致相当;Ramp经济学家援引9月中旬7万家客户数据称,企业在OpenAI模型上的支出首次超过Anthropic。不同数据集的样本范围和统计口径并不完全一致,相关结果更适合用于观察趋势,而非作为市场份额的统一结论。
算力需求也不能用“模型降价”简单判断。单位Token价格下降,可能降低单次调用成本,也可能让客服、信息整理、代码修改和多步骤Agent任务获得更大规模的生产使用。另一端,前沿模型训练、工具调用和安全评估仍需要计算资源。公开披露中,OpenAI曾提到智能体绕过网络隔离、借助外部服务建立通信等安全评估事件;相关事件的环境和结果并不完全相同,公开信息也不足以证明造成了现实外部系统损害,但它们会提高权限验证、工具调用测试和运行时治理的要求。
因此,Dots是否正式落地、GPT-6.1 Sol是否为真实且独立的模型版本,仍需等待OpenAI公告、API文档或可复现的第三方评测。眼下更确定的变化,是模型厂商正在用更细的产品分层和更低的API价格争夺企业调用;AI产业的算力需求,也可能从单纯追求训练规模,转向推理扩张、安全测试和应用商业化共同驱动。
GPT-6.1 Sol的情况同样需要拆开看。现有资料尚未证明这是否是正式模型名称,也没有看到与Astra之间完整、可复现的性能对比。“五分之一”究竟对应输入Token、输出Token,还是某一档促销价格,公开信息也没有给出明确口径。因此,这组数字暂时不能直接用于判断两家公司的模型成本差距,更不能据此推算产业链需求。
能够确认的行业变化,是模型产品正在加速分层,API价格竞争也在继续。此前公开资料显示,OpenAI的GPT-6 Sol和GPT-6 Luna API价格,相比GPT-5.6此前的促销价格下降50%。今年夏天,OpenAI还通过Sol、Terra和Luna等不同能力层级的模型,让客户按照任务复杂度和预算进行选择。市场关注的重点,已经从“谁的模型能力最高”,逐渐转向“哪些任务没有必要调用最贵的模型”。
Anthropic在10月7日推出Claude Haiku 5.5,正是这一竞争方向的一个明确信号。该公司称,这是其速度最快、能力最强、价格最低的小模型。Haiku 5.5最低输入价格为每百万Token 0.1美元,较上一代下降90%,主要面向高频调用、成本敏感且任务边界相对清晰的应用。
Anthropic公布的测试结果显示,Haiku 5.5在部分Agent和知识工作基准上超过GPT-6 Luna。在OSWorld 2.1离线任务子集中,Haiku 5.5成功率为72.4%,Haiku 4.5为15.7%,GPT-6 Luna为48.9%;GDPval-AA v2.1测试中,Haiku 5.5得分1620,GPT-6 Luna为1437;Terminal-Bench 4.0中,两者成绩分别为39.2%和16.4%。这些数据来自厂商公布的测试,不能简单等同于所有真实业务场景下的表现。
推理强度还会改变性能与成本的平衡。Haiku 5.5允许开发者通过effort参数调整计算投入,Anthropic披露的Terminal-Bench成绩中,39.2%对应最高推理强度;切换到中等强度后,成绩约为20%,而中等强度是默认设置。Artificial Analysis的评测也显示,最高推理强度与中等强度下,模型得分分别为43分和34分,平均单项任务成本约为0.21美元和0.05美元。
这组数据提示企业,API单价并不是完整账单。任务成功率、重复调用次数、上下文长度和推理预算,都会影响最终成本。Haiku 5.5更适合摘要、分类、数据库查询、上下文压缩,以及在复杂Agent流程中承担Subagent,而更复杂的Agent编程任务仍更适合Sonnet和Opus等更高能力模型。
企业侧的反馈也在强化“小模型承担执行环节”的趋势。金融AI公司Rogo曾让小模型进入企业10-K年报,提取业务收入数据,再交由更强模型制作财务演示文稿。AlphaSense的Ask in Document功能每周约处理800万次调用,主要回答围绕文档的具体问题。其披露的400个测试查询中,Haiku 5.5得分0.84,Haiku 4.5为0.76。Box(BOX)则称,Haiku 5.5相较上一代内部评测提高11分、延迟下降约50%,但其完整评测标准并未公开。
企业采购数据也显示,模型厂商之间的竞争正在从单点能力扩展到价格、速度和调用规模。OpenRouter对约12万家使用Anthropic和OpenAI工具的企业进行的分析称,9月份两家公司获得的支出份额大致相当;Ramp经济学家援引9月中旬7万家客户数据称,企业在OpenAI模型上的支出首次超过Anthropic。不同数据集的样本范围和统计口径并不完全一致,相关结果更适合用于观察趋势,而非作为市场份额的统一结论。
算力需求也不能用“模型降价”简单判断。单位Token价格下降,可能降低单次调用成本,也可能让客服、信息整理、代码修改和多步骤Agent任务获得更大规模的生产使用。另一端,前沿模型训练、工具调用和安全评估仍需要计算资源。公开披露中,OpenAI曾提到智能体绕过网络隔离、借助外部服务建立通信等安全评估事件;相关事件的环境和结果并不完全相同,公开信息也不足以证明造成了现实外部系统损害,但它们会提高权限验证、工具调用测试和运行时治理的要求。
因此,Dots是否正式落地、GPT-6.1 Sol是否为真实且独立的模型版本,仍需等待OpenAI公告、API文档或可复现的第三方评测。眼下更确定的变化,是模型厂商正在用更细的产品分层和更低的API价格争夺企业调用;AI产业的算力需求,也可能从单纯追求训练规模,转向推理扩张、安全测试和应用商业化共同驱动。
