上证报中国证券网讯(记者窦世平)从完成单项技能,到连续执行二十多分钟的长程任务,人形机器人(886069)正在加快从“展示能力”走向“完成工作”。
第二届世界人形机器人(886069)运动会期间,银河通用在家庭、餐饮和商超三项场景赛中均采用全自主模式参赛并获得冠军。赛后,银河通用创始人兼CTO王鹤在接受上海证券报记者专访时表示,当前具身智能规模化落地的关键,已经不只是机器人“能不能完成任务”,而是能否持续降低新任务的数据采集和适配成本。
王鹤判断,随着基座模型能力进一步提升,未来两年,部分任务可能不再需要针对性采集数据;到2028年,伴随数据规模扩大和训练更加充分,具身智能“很有希望”迎来属于自己的“ChatGPT时刻”。
从“能干活”到降低适配成本
以家庭场景赛为例,机器人需要连续完成物品收纳、衣物整理、开门、取快递等任务,还要应对中途插入的新任务。比赛过程中,当机器人正在执行清洁任务时,现场还会随机发出取快递指令,机器人需要暂停当前任务,完成取件后再恢复此前流程。
王鹤介绍,今年家庭赛全流程自主完成需要二十多分钟,银河通用最快以26分钟完赛。相比去年相对简单的场景赛,今年的任务流程更长,也更接近真实环境中的连续作业。
比赛也反映出当前模型能力的边界。王鹤举例称,如果针对Polo衫和牛仔裤采集并训练过数据,机器人可以较好完成相关操作;但如果换成此前没有充分采集数据的连衣裙,成功率就可能明显下降。
“今天不是没有能力完成任务,而是你把任务交给我之后,我要采集一定的数据才能完成。”王鹤表示,现阶段,为新任务采集数据所消耗的时间和研发资源,可能高于任务本身产生的价值。
因此,在他看来,具身智能真正走向规模化应用,关键是让机器人面对新任务时越来越能够“举一反三”。
王鹤预计,目前可能需要两天完成的数据采集,半年后或缩短至5个小时;再过两年,部分任务可能无需再专门采集数据。与此同时,完成当前同类任务的成本可能降至现在的千分之一,动作速度可能提高至现在的两倍至四倍。
“整体成本降下来、效率提上去,它就越来越是一个产品。”王鹤说。
基座模型决定“举一反三”能力
为什么面对相近的数据量,不同机器人最终表现差异明显?王鹤认为,核心在于基座模型。
他介绍,家庭场景赛开放两天供各队采集数据,各队获得的数据量相近,但训练后的效果可能差别很大。“有的模型能做到100分,有的模型只能做到60分,很多模型如果只用这两天采集的数据去训练,差不多只有10分。”
在王鹤看来,基座模型的架构、吞吐的数据规模以及数据构成,共同决定了机器人迁移到陌生任务的效率。
银河通用构建的银河星脑(AstraBrain),使用互联网数据、人类数据、仿真合成数据、真机遥操作数据和真机回流数据等进行训练。王鹤称,目前模型在部分桌面抓取、放置、摆盘等轻任务上,已经具备一定的零样本成功率。
银河通用计划从今年到2028年,将相关数据规模从100万小时提升至1000万小时。王鹤表示,随着基模数据进一步增加,未来将出现越来越多零样本能力,即面对第一次见到的任务和物体,也能够直接进行操作。
在王鹤看来,这也是具身智能迈向“ChatGPT时刻”的关键。到2028年,随着数据规模扩大和训练更加充分,具身智能“很有希望”迎来属于自己的“ChatGPT时刻”。真正的变化,不只是机器人能够完成更多任务,而是面对新任务时所需要的数据和适配成本持续下降,从而推动机器人从能力展示走向更大规模的实际应用。
