DeepSeek V4 Pro正式版悄然上线
核心结论:8月12日深夜,DeepSeek将V4 Pro API从预览版切换为正式版;同一天,Grok 4.6在GDPVal-AA v2取得1753 Elo,超过Claude Fable 5的1741分。两件事都指向同一个变化:前沿模型的能力差距正在收窄。DeepSeek尚未公布V4 Pro的完整官方基准,低价与智能体能力能否带来持续增长的企业调用需求,仍是后续重点。
六家模型厂商围绕性能、价格与企业调用场景展开竞争。
V4 Pro上线,Grok 4.6登顶
8月12日深夜,DeepSeek官网API文档将模型版本从“V4 Pro预览版”切换为“DeepSeek-V4-Pro-0813”。没有发布会和更新日志,开发者通过文档及实际调用发现了这次变更。
几乎同一时间,SpaceXAI发布Grok 4.6。在GDPVal-AA v2这项面向真实专业工作的Agent评估中,Grok 4.6拿到1753 Elo,超过Claude Fable 5的1741分和GPT-5.6 Sol Max的1728分,排名第一。
两项更新发生在同一天,也让前沿模型之间的能力差距成为市场关注焦点。
一张流传的Agent评测对比图,将V4 Pro正式版与V4 Flash、V4 Pro预览版及多款前沿模型放在同一组任务中比较。图中显示,V4 Pro正式版在Terminal Bench 2.1、Cybergym、DSBench等多项任务上较预览版提升明显。不过,这份对比表并非DeepSeek正式更新日志内容,具体成绩仍应以官方后续披露为准。
V4 Pro支持100万Token上下文窗口、最高38.4万Token输出,支持结构化输出、工具调用、Responses API、Anthropic API兼容接口和代码补全。价格维持输入$0.435/百万Token(缓存命中$0.003625)、输出$0.87/百万Token。官方价格页同时提示,API服务整体价格将在未来调整。
模型能力接近,价格差距扩大
低价不必然等同于低成本。关键在于:当能力差距收窄时,价格优势能否持续取决于推理效率和底层算力成本。
按公开定价计算,Claude Opus 5的输入价约为DeepSeek V4 Pro的11倍,输出价约为29倍。Opus 5与Fable 5并非同一产品,这组定价不对应Fable 5。
前沿模型API定价对比(美元/百万Token)
低价背后是工程效率。公开技术资料显示,V4 Pro在100万Token上下文下的单Token推理计算量约为V3.2的27%,KV缓存占用约为10%;再配合FP4/FP8混合精度与推测解码,可降低单位Token的算力消耗。
OpenAI采用分层定价策略覆盖不同需求:旗舰Sol维持$5/$30,中端Terra降至$2/$12,入门Luna降至$0.20/$1.20。若DeepSeek后续调整价格,其价格优势可能收窄;实际竞争力仍取决于性能、稳定性和使用成本。
底层算力成本是大模型API定价的重要约束。H100一年期合同价格从2025年10月的每卡每小时1.7美元,上涨到2026年3月的2.35美元,涨幅接近四成;新一代GPU的采购成本也更高。行业持续普遍降价的空间正在收窄。
后训练为何缩小模型能力差距
前沿模型的竞争不只取决于参数规模。后训练效率、智能体评测的适用范围和技术扩散速度,都会影响不同模型之间的能力距离。
GDPVal-AA v2 Agent评估Elo排名
V4 Flash显示出后训练对性能提升的显著作用:其总参数2840亿、激活参数130亿,经过新一轮后训练后,Terminal Bench 2.1从61.8升至82.7,并在九项智能体测试中超过V4 Pro预览版。参数规模不再是唯一判断依据。
技术扩散也在加速:Kimi K3开源了模型权重和47页技术报告;MiniMax开放H3基础模型权重后,24小时内有9家芯片厂商完成适配。开放权重与统一接口降低了切换模型的门槛,也让使用者更重视价格和实际任务表现。
一项公开调研显示,46%的受访企业在智能体场景中使用4—6款模型,只有2%依赖单一模型。企业会按任务类型选择模型:简单分类更重视成本,复杂代码更重视能力,常规智能体任务则兼顾价格与效果。
多模型并行后,价值如何分配
前沿模型增加、智能体能力提升、API价格下降,会扩大可自动化任务的范围。推理调用需求能否持续增长,还取决于企业付费意愿、模型稳定性和具体应用的交付效果。
Anthropic与OpenAI年化运行收入估算(亿美元)
推理算力增长不等于模型厂商利润同步增长。据SemiAnalysis估算,Anthropic年化运行收入约690亿美元,同期OpenAI约420亿美元;Anthropic约75%—85%的收入来自API按量计费。上述均为第三方估算,并非公司官方财报披露。
国产模型的商业化数据也在变化:据公司业绩会信息及媒体报道,智谱MaaS的ARR从3月约2.5亿美元升至7月约10亿美元;MiniMax 4月ARR约4亿美元。上述数据并非财报口径;DeepSeek尚未披露收入数据。
风险在于模型更容易被替换:如果企业能够低成本切换模型,模型厂商的定价能力可能承压;能持续提供独特能力或显著成本效率的厂商,更有机会形成差异化竞争力。
多模型竞争如何传导至A股
多模型并行部署和推理调用增长,可能带动三个环节的发展。算力基础设施与模型调用最直接相关,但需求释放仍取决于企业部署节奏和数据中心建设投入。
其次是AI芯片国产适配:推理算力增长叠加外部供应限制,提升了国产芯片的适配需求。已有多家国产芯片厂商宣布完成对V4的首日适配,其中包括寒武纪、海光信息和昇腾;推理场景的国产替代进展仍将影响相关需求释放。
再次是AI应用:代码智能体与办公智能体是当前落地相对较快的方向。据艾瑞咨询,中国企业级AI智能体市场投资将从2025年的55.9亿元增长至2030年的815.1亿元。
中国企业级AI Agent市场投资预测端点(亿元)
| 指标 | DeepSeek V4 Pro | Grok 4.6 | Claude Opus 5 | GPT-5.6 Sol Max |
|---|---|---|---|---|
| 输入价格($/M) | 0.435 | 2 | 5 | 5 |
| 输出价格($/M) | 0.87 | 6 | 25 | 30 |
| 缓存命中输入($/M) | 0.003625 | — | — | — |
| 上下文窗口 | 1M | 未公开 | 1M | 未公开 |
| GDPVal-AA v2 Elo | 未公开 | 1753 | 未公开(Fable 5为1741) | 1728 |
| 公司 | 关联环节 | 业务关联 |
|---|---|---|
| 浪潮信息 | AI服务器 | 国内AI服务器份额领先,覆盖训练和推理 |
| 中科曙光 | 超算/算力 | 超算和AI算力基础设施核心供应商 |
| 中际旭创 | 光模块 | 高速光模块产品布局 |
| 寒武纪 | AI芯片 | 思元系列芯片覆盖云端推理和训练 |
| 海光信息 | AI芯片 | 深算DCU提供类CUDA编程环境,适配推理场景 |
| 金山办公 | AI应用 | WPS AI集成文档生成、数据分析 |
| 英维克 | 液冷散热 | 液冷全链条解决方案已有成熟布局 |
相关基金产品
以下基金与人工智能主题相关,持仓及涨幅以最新披露信息为准。
| ETF名称 | 代码 | 前五大相关重仓 |
|---|---|---|
| 科创创业人工智能ETF景顺 | 159142 | 海光信息11.50%、澜起科技11.13%、寒武纪10.28%、新易盛9.40%、中际旭创8.79% |
| 人工智能ETF万家 | 159248 | 寒武纪10.12%、新易盛9.63%、澜起科技9.06%、中际旭创8.86%、海光信息8.79% |
| 基金名称 | 代码 | 近一年涨幅 | 前五大相关重仓 |
|---|---|---|---|
| 融通互联网传媒灵活配置混合A | 001150 | +13.30% | 卓易信息7.77%、华正新材7.67%、国能日新6.57%、汉得信息5.41%、中控技术5.13% |