近日,南方科技大学电子与电气工程系系主任、加拿大工程院院士孟庆虎作专题学术报告,围绕“大模型加仿真机器人为什么还不行”这一行业热点问题,结合自身四十载机器人领域科研经历,梳理人工智能(885728)发展脉络,剖析当前大模型与具身机器人技术瓶颈,提出“场景智能”的务实发展思路。
孟庆虎演讲现场(陈霞昌摄)
报告伊始,孟庆虎回顾人工智能(885728)浪潮发展历程,从1943年神经元网络模型提出、1956年达特茅斯研讨会开启人工智能(885728)研究纪元,再到上世纪60年代麻省理工学院实现视觉引导机械臂堆叠木块实验,点明机器人技术的三大核心组成:信息获取、智能决策、执行机构。他结合自身科研经历,讲述上世纪80年代开展国内机器人视觉控制系统研究、90年代攻克六自由度机械臂力位自适应控制的科研往事,串联起全球机器人感知技术演进历程。
针对当下社会对大模型和仿生机器人的乐观预期,孟庆虎着重指出大众普遍存在的概念误区:当下广为讨论的“大模型”本质是大语言模型(LLM),以一维文本数据训练而成,擅长文字处理,但对二维图像理解存在缺陷,几乎不具备三维世界认知能力。人类认知世界遵循“三维现实世界抽象为二维图像,再凝练为一维文字符号”的路径,阅读文字时大脑依然会还原三维场景;而大语言模型以海量文本数据为训练基底,数字化文本仅占人类真实生活的极小部分,造成人类高维智能空间与AI低维智能空间的维度错配,这正是大模型接入机器人后表现不及预期的底层根源。
谈及近期火爆的人形机器人(886069),孟庆虎认为部分行业叙事带有资本宣传属性,不能直接等同于可行技术路线,当前人形机器人(886069)虽然可以完成跑步、行走等固定环境下预设动作,但惧怕现实环境的不确定性,缺乏自主任务规划与真实智能交互能力。孟庆虎预测,若要实现家庭养老等家庭场景落地,技术突破加上成本下降,整体大概率需要六至十年周期(883436),不宜过度高估短期产业化进度。
面对具身智能发展的三大现实障碍——不确定环境处理、自主任务决策、高质量智能交互,孟庆虎提出“场景智能”的解决方案,即不盲目追求覆盖一切的通用大模型,立足具体垂直应用场景,采集场景专属干净数据集,针对性训练轻量化专用模型,实现技术落地。他以团队研发的主动型胶囊内窥镜机器人、核酸采样机器人样机为例,两套系统均不依赖超大规模算力集群,依靠场景化专用模型,就分别完成消化道病灶筛查、核酸采样等实际任务,证明场景智能路线的可行性。
在报告中,孟庆虎也对通用人工智能(885728)(AGI)提出自己的判断:真正的通用人工智能(885728),或许是把一个个真实生活场景的场景智能全部覆盖之后,才有可能实现。当下所谓“AGI”,大多还局限在文本处理范畴。他引用强化学习之父理查德.萨顿(Richard sutton)观点,认为未来智能的发展方向,应当借鉴婴儿通过感知与行动进行自我学习的模式,而非盲目堆砌算力采集海量复刻动作数据,盲目复刻会造成模型仅能应对见过的场景,缺少举一反三能力。
