一波三折终上线!DeepSeek新版本发布,AI圈迎“疯狂星期四”

2026-08-14 11:38:04
分享
AIME

问财摘要

1、8月12日晚间,大模型厂商迎来新模型“三连发”,其中包括DeepSeek-V4-Pro正式版上线。然而,V4-Pro正式版的发布在24小时内经历了“一波三折”,出现了异常反馈。 2、随后,DeepSeek发布推文官宣V4-Pro正式版于网页端、App及API全线上线,并公布了调价方案。 3、V4-Pro正式版上线后,市场评价呈现分化,有用户认为其已达到Fable 5级别,也有用户表示失望。 4、此外,DeepSeek Harness(DSH)预览版也单独落地,以“开发者预览版(v0.1 版本)”名义,面向全球开发者开放测试。
免责声明 内容由AI生成
文章提及标的

7月到8月,大模型沙场战鼓频催,而过去的一天则堪称“疯狂星期四”。

8月12日晚间,国内外大模型厂商迎来新模型“三连发”:DeepSeek API文档中出现DeepSeek-V4-Pro-0813,V4-Pro正式版静默上线;Grok 4.6发布,纸面测评得分逼近Fable 5;参数规模达2.4T的Qwen3.8 Max也如期开放权重。另据记者了解,智谱(HK2513)新模型GLM 5.3也已接近发布,DeepSeek-V4-Pro先行一步。

不过,V4-Pro正式版的发布在24小时内经历了“一波三折”。

模型上线数小时内,社区实测陆续出现异常反馈,本应进行长推理的V4-Pro,思考时间经常不足十秒,长流程任务频繁提前收尾,部分场景表现甚至弱于V4-Flash。8月13日凌晨,有开发者用同一任务间隔几小时先后测试,结果差异悬殊,怀疑服务端进行过配置调整或版本切换。

8月13日白天,官网首页通知与开放平台公告一度撤回,API文档页面里的版本名则一直显示DeepSeek-V4-Pro-0813。有业内人士注意到,思考强度分档8月11日就已在API文档里列出,13日下午思考模式页有过一次修订。

当日晚间,DeepSeek发布推文官宣V4-Pro正式版于网页端、App及API全线上线,并同步公布了调价方案。官网首页通知恢复,官方更新日志中也首次出现了8月13日的相关条目。官方并未就上述变动及凌晨时段的服务波动作出说明。

此前虽有过大幅涨价预告,但调价方案中的涨幅依然超出部分用户的预期。此次调价将于8月17日0时生效,调整后将实行分时定价,高峰时段输出价格升至27元/百万tokens,为现行价格的4.5倍;缓存未命中价格升至9元/百万tokens,为现行价格的3倍;缓存命中价格则大幅上调至0.30元/百万tokens,为现行价格的12倍。空闲时段价格统一为高峰时段的一半。

此外,在8月13日晚间V4-Pro正式版官宣一个多小时后,DeepSeek Harness(DSH)终于单独落地。DSH团队的“黑鲸”公众号发布公告,宣布以“开发者预览版(v0.1 版本)”名义,面向全球开发者开放测试,并同步以 MIT 协议开放源代码。

发生了什么?

V4-Pro正式版上线后的这一连串波折,背后究竟发生了什么,又意味着什么?

社区中对此众说纷纭,有人怀疑官方临时发错了模型版本,有人推测部署出现了问题,有人猜测V4-Pro的表现未达预期,暂时撤下以待后续满血版上线。

有业内人士向记者分析,这一系列迹象更像是发布环节出现了问题,当晚线上服务状态大概率发生过变动。外部目前无法确认此前调用到的是首发版本、回退版本还是修复后的版本,在官方说明版本状态之前,不同时段的实测结果之间缺乏可比性。

在该人士看来,晚间的官宣反过来坐实了白天的撤回,撤的是发布仪式,调用入口一直没动。分档参数早就写在文档页上,前一夜的问题是行为没跟着档位走,本该长思考的请求思考不起来。晚间官宣把“更灵活的思考强度控制”写成卖点,对照之下,指向的还是服务端配置。

新加坡无限对齐创始人、Codex生态合作伙伴宋斐对记者表示,这里叠着三件不一样的事:深夜切API流量,白天撤页面公告,晚间把官宣、价目和思考开关补进同一套话术。流量最难退,因为第三方已经接上;页面和公告则随时能撤能发。API名称从头到尾没有动过,第三方平台也没有发V4-Pro下线通知,能确认撤掉的,只有官网通知和开放平台公告。

他分析,版本号和官方跑分都没变,说明没有换过权重。模型本体若有问题,官方不会只撤页面,API也会一起下。问题更可能在部署配置和配套节奏。他强调,正式版身份的确认和对标Fable 5的能力验证是两件事,前者在13日晚间完成了,后者要等第三方拿着刚开源的DSH在固定版本上复测之后才有答案。

评价褒贬不一

此前,7月31日上线的DeepSeek-V4-Flash正式版,因为出人意料的性能跃升和极致性价比而收获如潮好评,其祭出的大模型“斩杀线”也抬高了外界对V4-Pro正式版的期待。

但V4-Pro正式版上线后,市场评价却呈现分化:有用户认为其已达到Fable 5级别,也有用户表示失望。

从DeepSeek官方公布的评测结果来看,V4-Pro正式版相较此前V4-Pro预览版实现代际提升,并整体优于V4-Flash-0731。

而与前沿模型相较,从官方测评结果看,V4-Pro在执行类任务上已追平Anthropic前沿模型,但在基础智能上仍存在一定差距。

具体来看,在考察终端操作能力的Terminal Bench 2.1测试中,V4-Pro-0813得分87.9,与Fable 5的88.0仅差0.1分,高于Opus 4.8的85.0分;在考察真实世界长周期(883436)工程任务能力的DeepSWE测试中,V4-Pro得分62.7,低于Fable 5的70分,但高于Opus 4.8的58.0分。

相比之下,在考察基础智能的HLE测试中,V4-Pro-0813得分42.7,低于Fable 5的53.3分和Opus 4.8的49.8分;在考察仓库级长程代码生成能力的NL2Repo测试中,得分比Opus 4.8低8.2分。

根据美国研究机构Artificial Analysis最新独立评测,V4-Pro-0813的智能指数为53分,低于Fable 5的62分、Grok 4.6的61分、Kimi K3的60分和GPT-5.6 Terra的57分;同时,仅比V4-Flash-0731的50分高1分,与6月发布的GLM-5.2大致处于同一档位。有业内人士以“不及预期”形容其基准测试表现。

目前V4-Pro-0813的官方跑分尚未得到第三方复现。根据社区在8月12日模型上线后的即时反馈,V4-Pro-0813处理复杂任务的完整度有所提升,但与V4-Flash的差距并没有想象中大,甚至在某些编程任务中不如V4-Flash,整体表现没有超出预期,且不同时段的表现差异明显。“以Flash数倍的参数做出来的模型不该是这样。”有开发者指出。

与此同时,社区反馈显示,将DeepSeek-V4-Pro API接入Claude Code后,实际体验不及预期;而接入OpenCode后,表现则明显改善。

对于上述落差产生的原因,宋斐认为更多来自接入协议,而不是模型忽强忽弱。V4-Pro正式版新增支持 Response API 和 Codex 接入,对已经在用Codex的团队,路径比走兼容层短,行为也好控一些。同一模型换框架,分差往往出在协议:推理状态回不回得全、工具预算谁说了算、并行能不能关,在长任务里这些差异会被放大。

随着8月13日晚间DeepSeek Harness预览版的推出,上述模型能力与实际体验之间的落差,有了可以验证的环境。

至于8月12日上线当晚社区反馈的思考时间过短、任务提前收尾现象,宋斐认为,这从工程上看更像推理服务的配置问题:思考模式有没有真正打开、预算如何映射到服务端。权重在几小时里反复换的概率低。

宋斐注意到,思考分档8月11日就在文档里,13日下午思考模式页有过一次修订,正好卡在凌晨异常之后、晚间官宣之前。这个顺序和前述配置层修复的判断对得上,13日晚间的官宣公告等于把修过的这层收进了正式说明。“测试V4-Pro要显式指定思考档,默认档的结果参考价值有限。在官方把版本状态说清楚、外界能对着固定版本复测之前,建议先不要给模型本体下判语。”

调价后“斩杀线”还在吗?

眼下,V4-Pro正式版相比于拼智能上限,更硬的仍是性价比。

根据8月17日前的现行价,其调用费是V4-Flash的3倍。Artificial Analysis测评显示,V4-Pro每项智能指数任务的加权平均成本为6美分,是V4-Flash-0731的2倍,不到Fable 5的1/50,约为Kimi K3的十四分之一。不过,其成本已高于GPT-5.5 Luna的5美分。

调价后,按高峰时段计算,V4-Pro的缓存未命中输入价格仍约为Kimi K3的45%,相较海外旗舰模型依然便宜数倍。

宋斐指出,这轮调价中上调幅度最大的是缓存命中价格,从0.025元/百万tokens涨至高峰时段的0.30元/百万tokens,涨至原价的12倍。靠高命中压成本的长上下文Agent,成本压力将显现。而高峰时段输出价格则变为原价的4.5倍,也高于市场此前约3倍的预期。要建成本基线或做批量压测的团队,得在8月17日零点调价前做完。

在宋斐看来,此次V4-Pro正式版对按任务计费的Agent交付冲击更大,而对按智能上限计费的市场而言冲击相对有限。这还只是DeepSeek第一轮往Agent方向训练,后面仍有空间。

“从初步接入和社区反馈看,V4-Pro正式版适应性强,稳定性差。同一道题跑十次,一条轨迹很好,下一条出低级错,平均分没太大意义,多路尝试再加外部筛选,才是用法。现阶段要稳的团队可以继续用V4-Flash正式版;评V4-Pro,放在协议对齐的环境里,等版本状态稳住再下结论。”宋斐表示。

后训练跑通了,但短板也在后训练

V4-Flash和V4-Pro的正式更新,都是底座不变,仅通过后训练提升Agent能力。这也让后训练的重要性再次成为行业关注的焦点。

4月24日发布的V4系列预览版中,V4-Flash总参数规模为2840亿、激活参数130亿,V4-Pro总参数规模为1.6万亿、激活参数490亿,均采用MoE(混合专家)架构,并支持100万tokens上下文窗口。

7月31日,V4-Flash正式版上线。官方表示,在模型架构和参数规模均不变的情况下,仅通过后训练实现Agent能力提升。在DeepSWE测试中,V4-Flash正式版得分从预览版的7.3跃升至54.4。

两周后,V4-Pro正式版上线,同样没有更换模型底座,通过后训练将DeepSWE得分从12.8提升至62.7。

“这说明DeepSeek的后训练已经成体系,而且能在不同规模的底座之间复用,前提是两套底座吃的是同一套数据。”宋斐表示,“预览版分低,我一直不认为是能力不行。能力在权重里,只是还没被训到Agent任务上。后训练做的事,是把执行环境的任务分布写进权重。”

不过,V4-Pro正式版的总参数规模是V4-Flash的5.6倍、激活参数是3.8倍,却没有带来等比例的分数优势,也引发业内关注。在Artificial Analysis的智能指数评分中,V4-Pro-0813也仅比V4-Flash-0731高出1分。官方测试中,V4-Pro-0813的ALE也只高0.5分,Toolathlon高3.8分,DeepSWE、DSBench-Hard这类高难任务高7到8分。

“Pro的价值主要堆在高难任务、知识密集诊断和长链条恢复。”宋斐表示,两款模型分工也清楚:Flash铺量,Pro啃难题、接失败,二者并非替代关系。

开发者Jun Song则直言:“中国模型公司在小模型上表现得异常出色,例如Qwen 27B、V4 Flash和GLM-5.2,但到了更大的旗舰模型,能力提升往往没有随着参数同步放大。”他认为其原因“也许是训练算力不足”。

对DeepSeek而言,后训练作为Agent能力提升路径已经得到验证,但模型能力要继续向上突破,后训练也是其短板,训练素材不足的问题正在凸显。

“第三方用极简框架测出V4-Flash正式版的分数能和官方分数打平,说明这轮增益已经写进权重,自家积累的可验证任务,模型基本学透了。同一批任务反复训练,收益会递减,继续提升需要更宽的任务来源。这也是他们同步推公共Harness的原因。”宋斐指出。

Harness单独发布,显示分量

海通国际近期研报指出,模型竞争正从参数规模转向后训练与系统工程。未来模型实际效果将越来越取决于“模型+Harness+工具+数据”的整体组合,单纯依靠基础模型能力建立壁垒的难度继续上升。

在宋斐看来,DeepSeek Harness不只是开发工具,也是标准接口和数据入口。在条款允许的范围内,开发者跑长程任务留下的轨迹和纠错,可以回流训练。谁占住开发框架,谁就相当于让付费用户帮自己做强化学习里最贵的那一段。

因此,8月13日DSH预览版的发布及其后续反馈与进展,尤其值得关注。

在发布的公告中,DeepSeek提出了DSH“一切皆插件”的设计理念。其采用插件式开放架构构建Agent Harness,模型、工具、技能、会话、沙箱、存储、循环、调度、UI等所有Agent能力均由插件组合而成,可自由替换、灵活重组。

同时,DSH提供四种运行模式——标准模式、PTC模式、极简模式、创造模式,各模式默认加载不同的插件集合。其中“极简模式”仅保留一个shell工具与一个文件编辑工具,官方称是用于最小环境下的模型基准测试。这意味着,第三方复现官方评测分数的环境条件已经具备了。

此外,模型看到的一切,都会写入仅追加(append-only)设计的会话日志,包括系统提示词、思维链、工具调用与结果、子Agent调度,以及每一次上下文注入。在 Trajectory 视图中,可以按来源查看这些信息。恢复、分叉、检索与回放也都共享同一份事件流。

宋斐认为,DSH预览版的架构,把模型在DSH里做成插件,与工具、沙箱、界面并列,可替换。也就是说运行时是主体,模型是其中一个部件,“这个位置由模型厂自己排出来,分量不一样”。

更进一步,他指出,轨迹这层,会话日志记全了模型看到的一切,但记录不等于判定,事件流里还看不到步骤级的对错标注,预算、允许集和停止条件也没有成为产品。对高方差模型,运行时的价值一半在让模型发挥,另一半在让它停得下来。v0.1版本把发挥的一半搭起来了,停的那一半还空着。

DeepSeek Harness终于真的对外开放了,而模型在这之前的24小时里,经历了静默上线、首页公告撤回、晚间再官宣的过程。一边是波折的模型发布,一边是单独成篇、开源开放的运行时发布,两场同天上演,轻重自见。V4-Flash与V4-Pro正式版与其说是“价格屠夫”的又一次亮剑,不如说是这条线的起点。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME