阶跃星辰朱亦博:AI基础设施与模型能力的融合促生

2026-07-21 15:48:29
来源:投资界
分享
AIME

问财摘要

1、阶跃星辰联合创始人、首席技术官朱亦博在2026世界人工智能大会“启明创投·创业与投资论坛”上发表主旨演讲《AI基础设施与模型能力的融合促生》。朱亦博提到,阶跃是国内比较有名的基础大模型创业公司,他们一向出名的是多模态相关的能力,也做技术语言,现在也做Agent。 2、朱亦博还分享了公司在AI模型基础设施联合设计方面的体会和经验,以及他们的模型迭代和成绩。此外,他还谈到了当前AI发展的三个阶段:模拟世界阶段、探索世界阶段和归纳世界阶段。 3、朱亦博还提到,在模型设计和软件设计方面,需要在单位算力下压榨出更多的智能出来,才能满足需求。他还介绍了阶跃的3.5 Flash和3.7 Flash模型,并强调了速度的重要性。 4、最后,朱亦博表示,阶跃一直相信多模态是未来的趋势,他们主要做视觉的理解,还有语音的对话、实时等。
免责声明 内容由AI生成
文章提及标的
人工智能--
创投--
半导体--
知乎--
智谱--
查看股票机会,下载客户端

7月19日,阶跃星辰联合创始人、首席技术官朱亦博在2026世界人工智能(885728)大会“启明创投(885413)·创业与投资论坛”上发表主旨演讲《AI基础设施与模型能力的融合促生》。

以下为部分发言实录,投资界整理:

朱亦博:阶跃是国内比较有名的基础大模型创业公司。我们一向出名的是多模态相关的能力,也做技术语言,现在也做Agent。今天我想来跟大家分享一下,我们在最近进入Agent时代以来,在AI模型基础设施联合设计方面的一些体会和经验。

最开始,我一般还是喜欢从经典的图开始。因为刚才Alex也提到了,现在AI变化非常快。但如果一张图或一个路线能够持续说两年还依然在应验,那它是非常有价值的。这个其实是2024年初我们大模型CEO出来讲我们对AI发展路线时画出的这张图。我们大概把AI发展分为三个阶段。第一个阶段,也就是2024年的时候,处在所谓模拟世界阶段。我们把大量的预训练数据灌进去,模型就可以像一个人一样跟人聊天,它其实在模拟人。然后,接下来是去探索世界。其实到了强化学习阶段,也就是后来2024年下半年到2025年,包括OpenAI的强化学习方式。强化学习有一个非常经典的例子,就是AlphaGo。它强化学习做到最后,可以比老师还强,不仅是在模拟模仿老师,实际上还可以创新出一些新的东西,甚至做得比人还强。它可以从牙牙学语、学人类说话,进化到可以帮人类办事。能够帮人类办事,才能发展出比如我们现在谈的聚成智能能力、智能终端后面会说的一些能力,当然最基本的一些代码、帮人写代码这些能力。第三阶段是归纳世界。我们也预期它会发生的,也就是说它不再只是使用以前人类积累的一些技能排列组合去做事,而是能够归纳出新的科学规律,基本进入了AI for Science的阶段。现在我也看到一些初创公司有在聊这些事情。最下面这一行,其实是同期OpenAI可能比我们晚几个月,但OpenAI影响力在那儿,所以大家比较常用的AI发展五个阶段。大家可以看到,相对是比较匹配的,从聊天机器人到我们现在所在的智能体时代,再到后面是开始创新。

再多说一下我们现在所处的时代。用OpenAI的五个阶段,我们当然处在L3的智能体时代。标志事件是标志产品去年下半年开始Claude Code,然后OpenAI Codex开始比较多地出现,大家发现它真的可以替代很多日常编程的工作。再到今年上半年的Manus,先吃小龙虾,然后再是Manus这些更比coding更通用的出现。这基本上就是智能时代的开启,以及到现在非常火热的状态。像我们公司,HR、法务、财务一些没有任何技术背景的人都人手一个Agent帮助他们做日常工作,这确实非常有效率。

下面是我们阶跃的一些模型迭代,从Step 1到Step 3.7,下一版Step 4也非常快就要发布了。也有一些成绩。在还没有到Reasoning时代的时候,我们有国内比较早的一个近万亿参数的模型Step 2,那时也拿到了一些榜单的第一。当然,这还是Reasoning爆发之前的事。到了最近,是我们的Step 3.5系列,那是我们的第一款Azure模型,也取得了非常好的成绩,体现在非常受用户欢迎。在整个二六年的三月份,它是全球调用在OpenRouter上调用第一多的模型,排名第一。为什么会这样?我后面会解释这个模型的一些原因。

我还是想先把我们现在面临的一个现状,以及在启明创投(885413)这些谈谈一些投资逻辑来说一下。这张图我发现每次左边这张图,只要我不是第一个发言的,基本上都不是第一个收的。好像大家都有这张图。我这少了四百多倍,少了一个一,其实一千四百多倍,从100B到140T,这是国家数据局的统计。Token增长就不用多说了。右边这张图是我额外画的,给大家看一看我们实际支持这些Token需要算力。我们的算力是什么增长速度?不足三倍,这也是工信部这些权威的统计。那我们怎么用三倍的算力支持了一千多倍Token的?说白了吃老本。在之前的几年,算力可能有一些过度建设。现在的状态是我们基本老本吃完了。现在咱们可能有一些也做Token生意的同行或企业,出去找卡你试试,一卡难求。现在进入算力非常紧张的状态。如果我们还要支持Token继续翻倍,再加上模型的尺寸大家也在慢慢做得更大,这对Infra的要求挑战越来越大。一方面我们当然希望半导体(881121)行业能够智能起来,再冲一冲,但还有就是我们模型设计和软件设计要能够在单位算力下压榨出更多的智能出来,才能满足我们的需求。

除了刚才说的算力压榨出智能,谈的还是一个性价比。但是Agent时代又多了一个维度。从性价比你又要高智能又要低成本的两难,又进一步变成了一个不可能三角,就是多了一个速度。右边是我在发表3.5的时候在知乎(ZH)上稍微写了一篇文章,也有上千的同行给我点赞,感谢大家支持。其实说的道理很简单:过去聊天机器人的时代,我们模型的推理只需要超过每秒二十个Token就够,因为人类的阅读速度就这么快。你真的到豆包上让他回问他一个问题,哗的一下给你几百个字,你也读不过来。但是,现在进入Agent时代以后,没有什么人再去比如我让他做一个编程任务或其他任务,我不会去看模型思考的过程和工作的过程,我要的是模型尽快把那个最终结果交付给我。你能十秒钟做完,就不要拖到一分钟。而且这会影响用户的体验,这也是为什么我们3.5 Flash很受欢迎的原因。同样一个任务,我们用十秒,别人用一分钟,大家就喜欢用我们,就这么简单。所以,在模型这一侧和软件这一侧,又多了一个速度的维度,而且速度变成是值钱的了。不像以前说超过二十Token就没什么大差别。

所以,这边我也说一下,我们的3.5 Flash、3.7 Flash模型,客观来说,它是一个Flash模型,不是绝对意义上智能最高的模型,这个还是基本是OpenAI。但是在Artificial Analysis大家会经常去看的评价榜单上,它还有一个维度,就是带上速度和成本的维度。然后你会发现我们是基本第一或名列前茅的。这就是我们在Agent时代,能够在那个时候获得很高调用量的原因。当然,技术一直在革新,速度别人也会追上来,我们的智能也要一步步迭代新的模型。反正业界最大的不变就是变化,我们还会继续努力。

第二个,延续刚才的话题。我喜欢拿过去的来做对照。左边这张图是我们在去年这个时候,去年七月份发的Step 3模型,那时画的最重要的一张图。右边是我延续上一页搬过来的一张图。这个图的横纵坐标其实说明了不同时代的优化目标。在上一个推理时代,或者说聊天机器人时代,我在意的是刚才说的智能,就是模型的尺寸,这些参数量。横坐标是成本,我希望它的性价比好。我通过模型的设计,具体技术细节不说了,通过模型的结构、设计软件的优化、针对国产芯片的适配。顺便说一句,我们可能是线上推理用最多国产芯片的大模型创业公司,也是因为做这些技术积累下来,使得我们可以用国产芯片去做推理。这方面,当时的优化目标是这个,我们体现出来是做的不错的。右边这张图是我们现在,或者说3.7这一代的优化目标。纵坐标是智能榜单的分数,横坐标是模型输出速度。你也看到我们跟其他也是所谓的Flash模型相比,我们在那儿。如果是巨大的模型会更慢,所以在输出速度上会更慢。我这里已经举了很多跟我们尺寸相应的Flash模型。我们做了很多技术,使得我们真的速度能够领先这么多。它在一些场景就会体现出非常大的价值,用户就会受到用户喜欢。

具体技术我就说一个例子,大家不一定能Follow,但大概Get意思。比如最近我们也发表了一篇叫投机采样加速模型推理。投机采样的意思是我以前模型是一次推一个Token,投机采样是我一次赌十个Token。

如果赌对了,我就赚大了。赌不对呢,我就回到一个Token。大概是这个意思,但我有对的几率,那我就可以有可能一次付出很多Token。这样平均下来的速度我就加快了。

好吧,然后在这方面呢,我们几乎是同一天发表,实际上我们早一天。就是大家英雄所见略同吧,都看到这是非常重要的一个技术点,然后其实做法也蛮相近的。但是我们调的更极致一点。然后到了实际上,我们可以用这种方式,包括模型的调整和系统的调整,让用户体会到的这个Token输出速度达到这边写的9.64倍。

那个工作大概要七倍。

所以都开始重视这个方向。因为这个确实对AI在实际使用中还是可以给用户提供价值。单单速度快这一点,以至于说甚至我们可以单卡输出给单用户输出上千Token每秒。你可以想象,比三十Token每秒的以前上一代模型的部署方法,那完成Agent Task快三十倍。这个是数量级的差别。

好,然后再说一些共识、非共识。但是我不知道这个到底有多少共识、多少非共识。但是我们一直相信的还是相信多模态,然后相信AI也需要多模态。当然现在有人说,你看全文本Coding就可以了,这个智谱(HK2513)没有多么太……对吧?大家也聚得非常非常成功。但我们还是相信未来超出Coding以后,更多的要服务更多的用户。

我们是需要多模态的。这道理很简单,因为对人类而言,最高效的沟通方式是视觉的输入。对我而言,看东西,然后对我要输出观念,给大家最高效的是语音。对,就可以想象一下,如果我今天不上来给这个Talk,我给大家打印一张纸,你们自己读吧,我也不说了。那像话吗?效率高嘛,对吧?那还是要我这样来说,然后图文并茂地给大家展示PPT。对吧?但是你可以想象,现在的Agent,现在所谓Coding AI,跟用户的交互就是给你打印一张纸,你读吧。就是这样,对吧?然后你要跟他说话,你也打字跟他交流。这实际上并不是人类最高效的。可能对极客而言是比较自然的,但是对大众而言并不是最高效的。所以我们是坚持一直做多模态。当然,我们和前面说的多模态有一点区别,就是我们主要做视觉的理解,还有语音的对话、实时的对话这些多模态。然后这边也是积累了比较完整的模型矩阵,以支持我下面会说的我们的终端战略。

好吧,那这边还是举一个例子。比如我们最近也发布了一个语音模型。实际上这个语音模型呢,世界上也没有那么卷。但是我们还是去和这个世界最好的水平去比。最好水平就比如Gemini。我们实际上在语音识别方面已经超越了它最大最强的3.1 Pro了。然后在一些更深层次的理解上,已经很逼近它的大尺寸版本。但是像小尺寸,我们这个是遥遥领先的。所以在语音方面我们还是积累非常多。然后在我们展厅其实是可以去体验这个模型的。但还是Preview,后面可能再进一步提升。

嗯,说完这些多模态,有了这些多模态的东西,我们组织起来就可以支持我们。其实从20年以来,阶跃一直在做的战略。我们之前没有那么多说,现在开始说了。但现在其实还是有些东西我不能说。但是我们现在是比较摆在明面上来说,就是说我们需要做AI终端、AI硬件这件事情。但这个事情呢,对Infra也有相当挑战。像举个例子,比如说之前这个……我现在会High Level了吧。就是AI终端,我们认为要给用户去好好体验,还是要端云协同的方案。我不能说我只用一个小模型在端上,这个比云上模型还是差了一百倍的尺寸,智能差太多。但是像我不知道聚星豆包手机怎么样,但上一版豆包手机,比如他要操控你的屏幕,它实际上要把截图都发到云上。那大家能受得了吗?大家也受不了,隐私还是很严重的问题。所以纯端纯云都不好。我们还是相信需要一个端云协同的方案,才能给用户最好的体验。那这个地方其实是会给Infra带来挑战。一方面我们模型要全尺寸,云上模型有,端上模型有,Infra也需要端云是协同的。然后举个例子,比如大家知道前一阵小龙虾,很多人装了小龙虾,也买了一些产品。小龙虾里头,如果你付了一个月费,其实里头每个月几十块钱是付给虚拟机的。云上虚拟机,这Token费都才可能每个月几十块。对呀,你说模型很贵,结果虚拟机也要几十块。也就是说,我端上如果有一个端上的环境,但是有一个云上的环境配合它,就像双生一样,这样跑云上那个东西也要每个月几十块。这个成本可能对手机的用户也不是那么好接受。所以这边还是有很多Infra优化的部分。当然细节不说了,我们是有信心把它Cut十倍下来。但这边确实有一些额外的事情要做。那也包括说,我要训这种端云协同,端上一个模型,云上一个模型,他们要配合去完成一些任务的话,那我也要做强化学习。强化学习要仿真出一堆的手机环境,我才能让模型尝试去完成这种端云协同任务,给它Reward把它训出来。像这种Infra,其实以前也是没有的,是不成熟的,所以也需要做。当然这边,启明创投(885413)创投(885413)圈我也稍微提一下。我体会是蛮好玩的。就这个提供强化学习环境、提供强化学习或者这种Long-Horizon Trajectory的数据的感觉,都是国外的创业公司,国内没有创业公司干。我不太知道为什么。国外创业公司好多海外朋友来找我,说他们创了个业,然后说可以给我们提供环境做强化学习、什么数据,可以让我们提升模型能力。国内就好像比较少。

刚才说我们要端云协同嘛,所以我们也发布了一个端侧的模型。但其实不是一个模型,它是一系列模型,是基于我们对端上硬件的理解。因为我们也服务很多汽车厂商、手机厂商,有60%的国内大手机厂商都是用我们的模型。我们也基于这些理解,做了一系列我们觉得端应该跑来端上最重要的模型。比如刚才提到了操控你手机屏幕、按按钮的那个模型应该跑到端上。如果跑在云上,这个隐私实在大家受不了,而且有很多流量的问题。然后比如语音,语音要低延迟,也应该在端上。所以这边就是基于我们理解,我们也发布了这个端上模型。然后有一些核心亮点,也跑了一些指标。但最重要的是,会在几个月后上到我们发布的这个真正量产发售的终端产品上。

这边就是总结一下刚刚说的AI时代Infra需要多做的一些事情。需要运行长期运行的环境,需要协同,需要有一个记忆、Context Management、工具等等。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME