Agent不再只比模型单价:一项任务的真实成本如何被推理预算和多模型协作改写

2026-10-09 00:28:00
来源:同花顺iNews
作者:原创深度
分享
文章提及标的
市场正在传播一组极具冲击力的信息:OpenAI推出“全天候自主智能体”Dots,GPT-6.1 Sol性能接近Astra,标准Token价格只有后者的五分之一。

但截至目前,Dots是否已经成为正式产品、具体形态是什么,GPT-6.1 Sol是否为正式模型名称,以及它与Astra之间是否存在可比测试,公开信息尚不足以确认。“五分之一”比较的是输入还是输出Token、标准价还是促销价,也没有完整披露。

真正值得追问的,不是某个模型每百万Token多少钱,而是一项Agent任务最终花了多少钱。

从单次问答转向任务账单

传统API账单通常以输入、输出Token计价,Agent却很少只调用一次模型。一个完整任务可能包含多轮推理、工具调用、结果校验、错误修正,以及过程日志留存。模型先生成查询,再调用数据库或浏览器;工具返回结果后,模型还要判断是否可信,必要时重新调用。最终账单因此由多项变量共同决定。

单个Token更便宜,不等于一项完整任务更便宜。企业至少要同时观察输入Token、输出Token、调用次数、上下文长度和失败重试。若低价模型在复杂任务中更容易出错,重试和人工复核就可能抵消单价优势;若上下文不断累积,后续每一轮请求的输入规模也会扩大。

这也是“五分之一”不能直接用于产业链测算的原因。公开资料尚未披露GPT-6.1 Sol相对Astra的标准输入、输出价格和真实调用数据,不能把传闻中的API价差直接等同于企业任务成本下降。

推理预算正在改写性能与成本曲线

Anthropic于10月7日发布Claude Haiku 5.5,公开口径称其每百万输入Token最低为0.1美元,较上一代下降90%。厂商将其定位于调用量大、价格敏感的任务。

性能数据同样引发关注。Anthropic公布的结果显示,Haiku 5.5在OSWorld 2.1离线任务子集上的成功率为72.4%,上一代Haiku 4.5为15.7%,GPT-6 Luna为48.9%;在GDPval-AA v2.1中,Haiku 5.5得分1620,GPT-6 Luna为1437;在Terminal-Bench 4.0中,两者分别为39.2%和16.4%。

但这些数字不能脱离测试设置理解。现有公开材料并未完整呈现各项成绩对应的推理强度、测试子集和评测主体,因而不能据此得出“低价模型全面超过高能力模型”的结论。尤其是Agent编程和电脑操作任务,模型是否允许更长思考、调用多少工具,都会改变结果。

推理强度本质上是一项可调预算:预算提高,成功率可能上升,但响应时间、输出Token和调用成本也会增加。企业采购时,不能只看最高推理强度下的Benchmark(BHE),还要看中等强度甚至默认设置下的单位任务成本。厂商成绩必须与推理预算、测试环境和失败处理方式一起解读。

小模型更可能成为执行层,而不是替代一切

低价模型的价值,往往不在于独立完成最复杂的Agent编程,而在于承担高频、规则较清晰的环节:摘要、分类、数据库查询、上下文压缩和Subagent任务。强模型负责拆解问题、处理异常和最终决策,小模型负责批量执行,工作流由“单一模型包办”转向“不同能力模型分工”。

这种分工可以降低部分调用的边际成本,却不能简单推导为整体成本下降。复杂任务仍可能需要更高能力模型;如果执行层输出质量不稳定,强模型的校验次数反而会上升。企业真正要比较的,是任务成功率与总调用成本,而不是某个模型在价格表上的位置。

从API价格表走向单位任务经济性

OpenRouter对约12万家使用Anthropic和OpenAI工具的企业进行的分析显示,9月份两家公司的支出份额大致相当;Ramp经济学家援引7万家客户数据称,9月中旬企业在OpenAI模型上的支出首次超过Anthropic。两组数据都说明,价格变化可能带来模型使用扩张,但支出份额上升并不等于利润改善,也不能替代对真实业务产出的验证。

企业评估低价模型,至少应建立一张任务级账单:每项任务的成功率、单位任务成本、平均延迟、重试率,以及最终客户留存。计价时还要核对Tokenizer是否变化、长上下文是否触发额外价格、缓存读取是否有单独费率,并把工具调用、日志存储和人工复核纳入核算。

最有价值的观察场景,是客服回复、文本分类、数据整理和简单代码修改等高频任务。只有当价格下降带来更多生产调用,同时成功率和留存没有明显恶化,低价模型才真正完成了从“便宜”到“可规模化”的转换。

Dots和GPT-6.1 Sol后续能否兑现市场预期,关键不在宣传中的单价,而在正式定价、输入输出口径、推理模式、调用上限、工具权限和企业早期使用数据。公开信息继续补齐之前,市场交易的更多仍是产品分层与价格战预期。Agent时代的成本竞争,最终比拼的不是谁把Token价格写得更低,而是谁能用更少的失败、更少的重复推理和更合理的模型分工,完成同一项任务。
免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME
Agent不再只比模型单价:一项任务的真实成本如何被推理预算和多模型协作改写