生数科技骆怡航:通用世界模型:打通虚实边界,筑基物理智能

2026-07-21 16:24:08
来源:投资界
分享
AIME

问财摘要

1、生数科技CEO骆怡航在2026世界人工智能大会上发表演讲,分享了公司以视觉信息为核心,研发多模态生成和世界模型的实践和理解。他认为,世界模型是处理人与世界交互的关键,需要感知、预测和行动的闭环,同时需要足够的通用性和泛化性。 2、生数科技构建了通用世界模型的基座,提出了具身智能的统一架构,并发布了基于通用世界模型架构和理念的具身大脑。
免责声明 内容由AI生成
文章提及标的
人工智能--
创投--
Robot--
查看股票机会,下载客户端

7月19日,生数科技联合创始人、首席执行官骆怡航在2026世界人工智能(885728)大会“启明创投(885413)·创业与投资论坛”上发表主旨演讲《通用世界模型:打通虚实边界,筑基物理智能》。

以下为部分发言实录,投资界整理:

骆怡航:生数科技是一家以视觉信息为核心,研发多模态生成和世界模型的企业。我记得2024年我们分享的是多模态音视频生成模型。2025年,视频模型在整个内容产业里取得了极大的技术突破和商业化落地的突破。到了2026年,今年视频模型一样在不断的发展,但其实它的边界和潜力我们认为还没有被完全释放。所以这就是我们今天要分享的其中一个话题:以视频模型我们怎么样去思考更大的价值。世界模型当前我们认为还没有达到一个完全收敛和共识的状态,还在不断地做技术和产业的迭代。今天呢,我主要以世界模型为主题,跟大家分享在生数的理解和实践里,我们认为世界模型从哪里来,未来三年到哪里去。

首先,对于人的智能来讲,除了人与人之间的语言交流,在我们人脑里也会有一个指导我们行动决策的世界模型。比如说我们行动、骑车、做运动,除了视觉的感知,在我们人脑里也会做行动的预测和行动的执行。也就是说,在我们人脑里也会有一个小规模的世界模型不停地运转。对于人工智能(885728)时代,我们的目标就是希望去打造一个能够接近人类智能,甚至超过人类智能的完全智能的模型。除了我们现在看到的语言模型已经取得了极大的深度推理,包括自主行动的一些能力,我们认为在人与世界交互的过程中,也需要一个世界模型来推进整个人工智能(885728)的整体发展。为什么?首先,在人脑部分里,除了语言处理的部分,其实80%是在处理视觉的信息,以及我们所有行动的规划和决策。这种智能其实就是对物理世界的感知和动作的决策。如果大模型里只靠语言模型去理解世界,我们认为相当于只用了人脑极少量的大脑的能力。所以我们认为未来三年到五年的发展,一定需要一个模型层面,一定需要一个类似于语言模型当前能量以及其潜力的级别的世界模型。这个世界模型也一定会是一个大模型,是一个基座模型。

世界模型是什么?当前会有不同的解读,有不同的定义。在生数科技的眼里,我们认为世界模型对比语言模型,语言模型在处理人与人、人与文字之间的信息,而世界模型呢,其实是处理我们人与世界的所有交互。它需要像人一样去感知、思考和行动。早在2018年的会议里,其实就对World Model做了一个定义:它需要观察世界,同时它也需要去理解和思考世界。第三点更重要的是,要在物理世界里去行动,与世界互动。所以感知加预测加行动的整个闭环,而且这个闭环是一个动态的、持续的循环闭环。因为在我们人的行动里,大家可以想象和感知,我们不断地在感知行动的变化,感知环境状态的变化,不断地去调节我们对于状态的感知以及行动的决策,再作用于行动。这个循环往复的闭环,我们认为构建模型的一个底层逻辑。

世界模型不是什么?我们会认为交互的视频生成仅仅是在数字世界里做一个交互的视频,它不等于世界模型。同时,会有这种3D空间的重建,包括4D的生成,我们也认为不会完全等同于世界模型。同时,以语言模型、VLA为主的视觉行动和Action的模型也不等于世界模型。因为我们认为这种底层逻辑不具备一个完整的闭环,同时它也不具备类似于人脑去思考世界交互的动态反馈循环。所以这种局限,我们认为它会比较难以实现级别的智能能力。所以简单来讲,我们总结的世界模型是需要感知预测加行动的一个动态循环的闭环。直接来讲,我们认为它类似于我们一边看,一边思考,一边行动,同时也在不断地调整。

另外一个角度,有了世界模型的底层逻辑,世界模型是否是一个场景类的世界模型?比如就是一个具身在家庭场景的具身世界模型,或者在一个工厂里的世界模型。我们认为可能都不足以去刻画或推进整个世界模型最大的潜力。其中一个关键词,我们认为世界模型也需要像语言模型一样足够的通用、足够的泛化。为什么?第一,这代AI最本质的效果其实就是通用性和泛化性。背后的技术路径最本质的是因为它的Scaling,包括数据的预训练、数据的大规模化,以及架构能支持预训练数据去消化,同时在效果上能产生极大的泛化性。通过不断的量变引起质变以及智能涌现,这是第一个路线。我们认为世界模型可以做到足够的通用化。另外,如果不够通用化,我们会认为会有几个问题,就是当前路线已经看到的一些局限或弊端。第一,已有的方案其实是非常分割和碎片化的,包括作为的模型是一种。第二,视频生成本身只是在数字世界里做模拟,也是一类。同时,在行动领域会有专门去做行动模型去驱动。每个环节都能处理一部分,但很难去构成一个完整的模型。第二,也类比于人,我们觉得人去与世界交互是一个统一的架构,能够实现系统级的能力,而不是单点的能力。第三,如果模型要在整个物理世界里实现规模化和商业化的落地,它需要具备很容易迁移、很容易复制的能力。就像语言模型一样,有了强大的语言模型,它在各种场景里做Agent做任务都能很好地完成。所以通过这几点,我们认为世界模型除了刚才我们讲的感知预测和行动的闭环,同时一定要往更通用、更泛化的目标去做。

在这样的理解和认知思路下,生数科技构建了整个通用世界模型的基座。这个基座就是我们认为的世界模型,在生数公司去做的一个最核心的战略目标。底座我们会构建一个通用世界模型的基础架构。这个架构会以丰富的视觉信息、听觉信息,包括物理世界里的触觉、力学等信息为所有数据的部分。同时,架构上也需要一定的创新。在两个空间里,一个是数字空间,就是我们现在已经可以去用到的世界生成模型。它其实是对物理世界进行了建模、抽象和理解之后,在像素空间的一个解码和能力的显现化实现。另外,如果它的解码空间是在具身的物理操作上,它构成了世界行动模型。我们也可以简单把这个架构认为是一体两翼的一个统一架构。

进一步,在这个架构里,我们在去年12月份全球首次提出了具身智能的统一架构。这套架构是把刚才我们提到的理解、感知预测还有行动,作为一个统一的建模空间,我们构建在一个模型里,去实现整个理解、预测、行动的闭环。第二,我们也认为大道至简。我们认为对于人去学习世界交互,如果它能够学理解到学会了,它首先还是能表达出来的。所以我们用朴素的像素预测来表征对世界的理解,这是第二点。所以它得有一个生成的空间在里面。第三,我们用同一套基座模型,对于世界整个构建能力可以去做两个空间的不同解码。它对整个世界的理解是一套,统一去在不同的空间里解码。所以这三个核心要点是我们提出具身智能架构的一套最核心的理念。

有了算法方向,我们对整个世界模型的配合创新之外,数据是作为整个模型很重要的一个维度。数据方向,刚才也提到了,数据一定是在具身领域、在物理世界领域会有一套不同的架构。我们提出了整个具身数据金字塔的结构。这套数据金字塔,我们是希望在整个世界模型的预训练,包括后训练里,能够去适配它的潜力,去突破通用化和泛化这个最核心的目标。最底层,大家可以看到是互联网视频数据,它会作为整个预训练的绝大部分核心数据,去先验地让模型理解整个世界的运行规律。它里面积累了大量的信息,而且这些信息是时时刻刻、每一分每一秒不停在记录。这些数据我们都可以完全用上,去充分发挥视频数据的价值。在网上呢,其实是需要六层,其中两类:一类是具身本体无关的数据,包括仿真、第一人称视角的数据;再往上一层是具身相关的数据、本体相关的数据,包括里其实还有一类是Imperfect的数据,就是很多脏数据,包括失败的数据、很多长尾数据,我们全部可以通过架构统一去消化这些数据。所以这套架构,包括我们设定的整个数据的体系,包括生数最早做视频模型积累的底层预训练的数据和架构,都会被这套架构所吸收。它可以寄希望于有效去破解整个在物理世界数据的瓶颈,高效地去消化每一层的数据。同时,我们希望它在同等数据量下,可以实现整个效果的快速飞跃。

进一步,有了这样的算法架构和数据体系之后,我们在今年4月份发布了基于通用世界模型架构和理念的具身大脑。这套架构是在全球首次,同一个模型驱动多个本体完成多项任务。而且对于本体的适配,我们是在半天到一天的时间里,通过少量的本体相关数据,我们做了微调和适配,使得几个本体能够去完成多样的任务。同时,它也具备了一脑多人去完成很多原子任务的一个自动拆解和协作,同时可以去做长程任务的规划和执行,同时也可以除了它理解的部分,去动态调整它的动作和执行。我们来看一个完整的视频。对,它是通过Motor Brain的通用世界行动模型,我们联合了本体的合作伙伴,一起在4月份做出来效果。接下来我们在9月份也会发布新的模型版本。进一步我们可以看到Motor Brain模型,利用短短的架构和数据方面的思考和实践,我们在整个具身领域的评测指标里也是突飞猛进,包括在Robot(LAWR)、World Arena等榜单里可以看到Motor Brain的指标进行了快速的提升。

同时,可以看到在数据的泛化性上,同等数据量下模型的准确率,以及在不同任务的泛化性上,多任务里的准确性。绿色的线是我们的模型,相比以往的VR模型,包括没有利用视频数据作为预训练的模型,产生了极大的提升。为什么能够取得高斜率加速,提升它的通用潜在能力?是因为生数科技我们在架构上,在二四年其实做了模型,它其实是一个模型,但在那个阶段已经取得了一些小场景的比较可行的决策和行动。同时,我们在二五年七月份的模型是第一个版本,我们用视频模型作为基座去做的一个具身模型,也产生了极大的提升。进一步,我们在二五年十二月份,Motors是我们开源的一个统一架构模型,这个架构模型相比之前的模型又取得了快速的增长。今年四月份我们正式发布Motor模型,所以一系列沿着这条路线,我们对物理世界交互的模型进行了快速迭代。这是一方面,我们能看到在效果层面、落地层面的一些突破。除此之外,还有一个很重要的核心,是因为在生成模型部分,我们的WeDo部分也对世界模型的能力提升产生了很大的加持。这就是最开始我提到的,要理解、预测和行动一体化,理解和预测的能力是能增强行动的能力的。

进一步,我们来看一下世界生成模型WeDo。我们在相关的一些迭代,它其实是在持续迭代对世界的理解,包括预测能力,它具备了很强的物理一致性。同时,在内容创作领域里,包括音画同出、智能运镜、多样风格都能实现。我们一起来看一下WeDo的演进过程。

好,这是世界生成模型部分WeDo的一些迭代。接下来,我们在下一个版本Q4版本,也会进一步增强模型的能力。同时,视频模型进一步我们可以提升视频生成的速度,那就是我们实时去感知,实时去交互。这是当前我们最近发布的WeDo S1模型,我们来看一下效果。

好,最终,生数科技的模型理念和目标是三个方向:第一,WeDo Q,作为视频理解和预测的基座模型,我们会不断去演进它在虚拟世界做内容生成的效果。同时,WeDo S系列,我们把虚拟和物理世界开始打通,作为实时交互。Motor Brain呢,就是想在纯物理世界里去做一个完全实时驱动的模型。整体这套架构就是生数科技的通用世界模型的核心定位。我们希望结合数字和物理世界,用统一的理解、预测和行动的整个架构,去实现人与世界更好的交互。

最终的理念或愿景,我们认为是什么样呢?首先,对于具身物理世界来说,我们认为未来所有的机器人,不同的本体,它其实就是物理世界的Agent,它可以像我们现在虚拟世界的Agent一样,去实现自主规划和执行。要达到这样一个目标,破局点就在模型。通用世界模型是我们认为最具潜力的技术路径。同时,数字和物理世界的Agent一定会产生千差万别、多种多样化的,但背后的智能我们认为它是通用的、泛化的、统一的。像语言模型一样,它使得模型跟人、人和Agent实现了像人一样的交流。同时,视频生成实现了机器跟人一样,可以像人一样去创意、去创作。进一步,我们希望通过世界模型去驱动整个物理世界的Agent,去实现像人一样行动。生数科技就会为这样的通用世界模型的理念和目标去努力。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME