DEEPTOPIC · AI大模型 · 2026-08-13

DeepSeek V4 Pro正式版悄然上线

API从预览版切换为正式版,模型能力与后续定价调整受到关注

核心结论:8月12日深夜,DeepSeek将V4 Pro API从预览版切换为正式版;同一天,Grok 4.6在GDPVal-AA v2取得1753 Elo,超过Claude Fable 5的1741分。两件事都指向同一个变化:前沿模型的能力差距正在收窄。DeepSeek尚未公布V4 Pro的完整官方基准,低价与智能体能力能否带来持续增长的企业调用需求,仍是后续重点。

全球大模型竞争格局

六家模型厂商围绕性能、价格与企业调用场景展开竞争。

六家前沿模型竞争格局图
点击图片可放大查看
查看更多专题 →
同花顺APP · 资讯 → 深度研究

V4 Pro上线,Grok 4.6登顶

8月12日深夜,DeepSeek官网API文档将模型版本从“V4 Pro预览版”切换为“DeepSeek-V4-Pro-0813”。没有发布会和更新日志,开发者通过文档及实际调用发现了这次变更。

几乎同一时间,SpaceXAI发布Grok 4.6。在GDPVal-AA v2这项面向真实专业工作的Agent评估中,Grok 4.6拿到1753 Elo,超过Claude Fable 5的1741分和GPT-5.6 Sol Max的1728分,排名第一。

两项更新发生在同一天,也让前沿模型之间的能力差距成为市场关注焦点。

1753Elo
Grok 4.6登顶GDPVal-AA v2
29倍
Opus 5输出价差
1M
V4 Pro上下文窗口

一张流传的Agent评测对比图,将V4 Pro正式版与V4 Flash、V4 Pro预览版及多款前沿模型放在同一组任务中比较。图中显示,V4 Pro正式版在Terminal Bench 2.1、Cybergym、DSBench等多项任务上较预览版提升明显。不过,这份对比表并非DeepSeek正式更新日志内容,具体成绩仍应以官方后续披露为准。

DeepSeek V4 Pro正式版与前沿模型的Agent评测对比
DeepSeek V4 Pro正式版与前沿模型的Agent评测对比(非官方公开披露数据,仅供参考)
2026年4-8月AI大模型关键事件时间线
图:2026年4-8月AI大模型关键事件时间线(点击放大)

模型能力接近,价格差距扩大

低价不必然等同于低成本。关键在于:当能力差距收窄时,价格优势能否持续取决于推理效率和底层算力成本。

按公开定价计算,Claude Opus 5的输入价约为DeepSeek V4 Pro的11倍,输出价约为29倍。Opus 5与Fable 5并非同一产品,这组定价不对应Fable 5。

前沿模型API定价对比(美元/百万Token)

数据来源:公开模型服务定价信息,截至2026-08-12。图中Claude价格为Opus 5,不对应Fable 5评分。

低价背后是工程效率。公开技术资料显示,V4 Pro在100万Token上下文下的单Token推理计算量约为V3.2的27%,KV缓存占用约为10%;再配合FP4/FP8混合精度与推测解码,可降低单位Token的算力消耗。

OpenAI采用分层定价策略覆盖不同需求:旗舰Sol维持$5/$30,中端Terra降至$2/$12,入门Luna降至$0.20/$1.20。若DeepSeek后续调整价格,其价格优势可能收窄;实际竞争力仍取决于性能、稳定性和使用成本。

29倍Claude Opus 5与DeepSeek V4 Pro的输出价格差(按公开定价计算)

后训练为何缩小模型能力差距

前沿模型的竞争不只取决于参数规模。后训练效率、智能体评测的适用范围和技术扩散速度,都会影响不同模型之间的能力距离。

GDPVal-AA v2 Agent评估Elo排名

数据来源:公开评测信息,截至2026-08-12。DeepSeek V4 Pro暂无官方完整基准数据。

V4 Flash显示出后训练对性能提升的显著作用:其总参数2840亿、激活参数130亿,经过新一轮后训练后,Terminal Bench 2.1从61.8升至82.7,并在九项智能体测试中超过V4 Pro预览版。参数规模不再是唯一判断依据。

后训练效果
训练策略会影响模型表现
V4 Flash在参数规模不变的基础上,经过后训练后取得更高的智能体测试成绩。
评测范围
分数接近不等于场景相同
不同测试考察的任务不同,模型在代码、工具调用和行业应用中的表现,应结合具体任务分别判断。

技术扩散也在加速:Kimi K3开源了模型权重和47页技术报告;MiniMax开放H3基础模型权重后,24小时内有9家芯片厂商完成适配。开放权重与统一接口降低了切换模型的门槛,也让使用者更重视价格和实际任务表现。


多模型并行后,价值如何分配

前沿模型增加、智能体能力提升、API价格下降,会扩大可自动化任务的范围。推理调用需求能否持续增长,还取决于企业付费意愿、模型稳定性和具体应用的交付效果。

Anthropic与OpenAI年化运行收入估算(亿美元)

数据来源:SemiAnalysis估算,非官方披露,截至2026-06-28。

推理算力增长不等于模型厂商利润同步增长。据SemiAnalysis估算,Anthropic年化运行收入约690亿美元,同期OpenAI约420亿美元;Anthropic约75%—85%的收入来自API按量计费。上述均为第三方估算,并非公司官方财报披露。

690亿美元
Anthropic年化收入估算
75-85%
估算收入来自API
Anthropic年化收入估算
690亿$
第三方估算
OpenAI年化收入估算
420亿$
同期估算
智谱MaaS ARR
10亿$
3月→7月约4倍

国产模型的商业化数据也在变化:据公司业绩会信息及媒体报道,智谱MaaS的ARR从3月约2.5亿美元升至7月约10亿美元;MiniMax 4月ARR约4亿美元。上述数据并非财报口径;DeepSeek尚未披露收入数据。

风险在于模型更容易被替换:如果企业能够低成本切换模型,模型厂商的定价能力可能承压;能持续提供独特能力或显著成本效率的厂商,更有机会形成差异化竞争力。

多模型竞争如何传导至A股

多模型并行部署和推理调用增长,可能带动三个环节的发展。算力基础设施与模型调用最直接相关,但需求释放仍取决于企业部署节奏和数据中心建设投入。

其次是AI芯片国产适配:推理算力增长叠加外部供应限制,提升了国产芯片的适配需求。已有多家国产芯片厂商宣布完成对V4的首日适配,其中包括寒武纪、海光信息和昇腾;推理场景的国产替代进展仍将影响相关需求释放。

再次是AI应用:代码智能体与办公智能体是当前落地相对较快的方向。据艾瑞咨询,中国企业级AI智能体市场投资将从2025年的55.9亿元增长至2030年的815.1亿元。

中国企业级AI Agent市场投资预测端点(亿元)

数据来源:艾瑞咨询(2026-07-31)。图表列示2025年和2030年预测值。
2025年市场规模
55.9亿
起点
2030年市场规模
815.1亿
CAGR 70.9%
核心数据对比
指标DeepSeek V4 ProGrok 4.6Claude Opus 5GPT-5.6 Sol Max
输入价格($/M)0.435255
输出价格($/M)0.8762530
缓存命中输入($/M)0.003625———
上下文窗口1M未公开1M未公开
GDPVal-AA v2 Elo未公开1753未公开(Fable 5为1741)1728
相关公司业务关联
公司关联环节业务关联
浪潮信息AI服务器国内AI服务器份额领先,覆盖训练和推理
中科曙光超算/算力超算和AI算力基础设施核心供应商
中际旭创光模块高速光模块产品布局
寒武纪AI芯片思元系列芯片覆盖云端推理和训练
海光信息AI芯片深算DCU提供类CUDA编程环境,适配推理场景
金山办公AI应用WPS AI集成文档生成、数据分析
英维克液冷散热液冷全链条解决方案已有成熟布局
风险提示
风险一:模型商品化
多模型路由让模型越来越像标准化商品,模型厂商毛利率长期承压,中间层厂商(定价中等、能力中等)的生存空间将被挤压。
风险二:AI应用层商业化仍有不确定性
应用能否形成可持续的商业模式、能否在竞争中胜出,仍存在较大不确定性;用户增长和付费转化是关键观察指标。
风险三:国产芯片高端训练仍有差距
国产芯片在高端训练场景与英伟达仍有明显差距,推理场景的替代进度更快,训练侧替代进程所需时间仍存在不确定性。

相关基金产品

以下基金与人工智能主题相关,持仓及涨幅以最新披露信息为准。

ETF产品(场内)
ETF名称代码前五大相关重仓
科创创业人工智能ETF景顺159142海光信息11.50%、澜起科技11.13%、寒武纪10.28%、新易盛9.40%、中际旭创8.79%
人工智能ETF万家159248寒武纪10.12%、新易盛9.63%、澜起科技9.06%、中际旭创8.86%、海光信息8.79%
场外基金产品
基金名称代码近一年涨幅前五大相关重仓
融通互联网传媒灵活配置混合A001150+13.30%卓易信息7.77%、华正新材7.67%、国能日新6.57%、汉得信息5.41%、中控技术5.13%
查看更多深度专题 更多深度专题可通过同花顺APP → 资讯 → 深度研究查看
去看看 →
驻足观望?不如做好准备! "想炒股,来同花顺" 超低佣金一站式开户 + 交易服务
立即开户 →