时隔近两年,李飞飞终于再做客a16z,畅谈空间智能World Labs在机器人赛道上的全盘布局


全程信息密度拉满,完全不敢眨眼!


李飞飞最新访谈:人也不全靠现实数据学习啊


  • 我们的目标是将空间智能打造为AI的下一个前沿。
  • 在物理空间中行动的能力,仍然是未来AI世界中最令人兴奋、也最具深远意义的能力之一,而机器人正是其中的核心。
  • 器人是空间智能落地的第一块试金石,也是世界建模重要的应用场景。
  • SceniX解决的正是机器人领域最困难的问题:训练数据和评估数据都非常匮乏。
  • 要让机器人真正工作,我们必须释放scaling law(缩放定律)的力量。
  • 真实环境评估不仅慢,而且还危险而昂贵。相比之下仿真环境具备完全的可控性与可解析性在可靠性和效率两方面都能提供独特价值。
  • 具体用哪个模型其实不重要,因为模型总会换代,但基础设施不会。


视频刚上线,评论区网友的脑洞就彻底放飞了。甚至还有人策划起了带机器人版的“鲁滨逊漂流记”,连需要带的装备都安排得明明白白!(啊这这这,这对吗?)


李飞飞最新访谈:人也不全靠现实数据学习啊


不得不说,这届网友的精神状态实在是太美丽,让人忍不住想立刻递上场记板喊一声“Action”。


李飞飞最新访谈:人也不全靠现实数据学习啊


最近,World Labs宣布收购SceniX,并计划与SceniX合作,为机器人打造一个可规模化的数字训练场。


紧接着,World Labs CEO李飞飞便与SceniX的联合创始人李昀烛共同做客了a16z最新的一期访谈《Fei-Fei Li is Solving the Hardest Problem in Robotics》,首次公开剖析了双方正联手解决的核心难题:让AI不仅能看懂世界,还能动手改变世界。


有趣的是,李昀烛还曾是飞姐亲自指导的博士后,究竟是一段怎样的故事促成了这次合作?


李飞飞最新访谈:人也不全靠现实数据学习啊


我们在不改变原意的基础上,由AI对访谈内容文字实录进行了精校。


Enjoy~


为什么机器人是空间智能落地的第一个试金石?


Martin Casado(主持人):飞飞,能否先为不熟悉World Labs的听众介绍一下公司的工作?


李飞飞:好的,World Labs是一家成立两年的初创公司,也是一家前沿模型实验室。


我们的目标是将空间智能打造为AI的下一个前沿。


简单来说,就是让AI能在真实或虚拟的空间中,自如地生成、理解、推理和交互。


构建大型世界模型是通往空间智能的一条路径,也是World Labs目前最关注的方向。


李飞飞最新访谈:人也不全靠现实数据学习啊


主持人:你从一开始就强调,机器要能够感知空间、对空间进行推理并在其中行动。我原以为在空间中行动还是很遥远的目标,但你们现在收购了一家机器人公司。为什么已经到了成熟的收购时机?这次收购的意图是什么?


李飞飞:机器人并不是在空间中行动或与空间交互的唯一方式。在VFX(后期视觉特效)、游戏和设计等创意领域,人们早已能在虚拟空间中构建世界并进行沉浸式交互。


World Labs始终有一个判断:我们所生活的世界可以成为一个多元宇宙,而我们可以创造技术,让用户、创作者和开发者在不同空间中行动。


不过,在物理空间中行动的能力,仍然是未来AI世界中最令人兴奋、也最具深远意义的能力之一,而机器人正是其中的核心。


World Labs一直认为,机器人是空间智能落地的第一块试金石,也是世界建模重要的应用场景。邀请SceniX及其团队加入World Labs,正是我们长期愿景和使命的一部分。


李飞飞最新访谈:人也不全靠现实数据学习啊


主持人:昀烛,你是SceniX的联合创始人。能否简要介绍一下你的背景,以及SceniX主要做什么?


李昀烛:大家好,我是李昀烛,我是SceniX的联合创始人,也是哥伦比亚大学的助理教授。


我的研究经历始于在MIT读博士的阶段,之后在斯坦福跟随飞飞老师做博士后。我的职业目标一直都很简单,就是想帮助机器人更好地感知物理世界并与之交互。


我是一个非常务实的人,希望机器人能在真实的物理环境中工作。


我们有注意到,目前通用机器人面临许多瓶颈,大多都集中在训练评估环节。因此,我们正在开发一条real-to-sim-to-real管线,把真实环境映射到与其高度对齐的数字世界。


所谓对齐,指的就是在数字世界中发生的事情,也应当能在真实环境中发生。


这样一来,原本必须在真实环境中完成的数据采集和评估,就可以部分由数字世界中可规模化生成的数据替代。SceniX正是由此起步。


我们组建了一支覆盖机器人、机器人学习、仿真和渲染的团队,并正在尝试构建一个完整的real-to-sim-to-real技术栈,以解决这些关键瓶颈。


李飞飞最新访谈:人也不全靠现实数据学习啊


李飞飞:这里还有一段很有趣的故事(笑)。你可能会以为,因为昀烛曾是我的博士后,所以我们很早就在讨论SceniX和World Labs合并的事儿。


其实不是。SceniX最初是作为客户来到World Labs的。


世界真的很小。去年冬天,大概是11月或12月吧,我们发布了生成模型Marble的第一个版本,SceniX第一时间注册并使用了它。


一开始我甚至不知道那是昀烛的公司。后面发现之后,我才给他打了电话,意识到World Labs和SceniX有很多合作空间。


李飞飞最新访谈:人也不全靠现实数据学习啊


主持人:能不能简单介绍一下Marble?


李飞飞:Ok。Marble是World Labs持续训练和迭代的基础模型。目前公开版本的核心能力,是接收单张或多张图像、文本或这些模态的组合,并把它们转化为一个几何一致的世界。


这个世界看起来非常真实且不会穿帮。


李飞飞最新访谈:人也不全靠现实数据学习啊


SceniX所解决的正是机器人领域一个极其困难的问题:训练数据和评估数据都非常匮乏。


这与语言模型很不一样,语言模型可以从互联网上获得丰富数据,但机器人不行。


要让机器人真正工作,我们必须释放scaling law(缩放定律)的力量。


那这些数据究竟从何而来?这是整个机器人界都在不断追问的深层问题。


World Labs与SceniX如何互补?


主持人:你们都组建了很有实力的团队。那么双方的能力有多少重叠,又在多大程度上扩展了World Labs的能力?


李飞飞:我认为两支团队高度互补,并且拥有共同的使命。


昀烛是SceniX的技术联合创始人之一。另一位是郑昌熙,他是哥伦比亚大学教授,也是世界级的仿真技术专家,拥有VFX背景。他曾在腾讯工作,也有过创业经历。


胡晓晨(Sonny)则是一位出色的工程负责人,曾就职于一家后来被亚马逊收购的初创公司,并在亚马逊参与过多种计算机视觉技术栈的工作。


昀烛带来了机器人领域的思想领导力和技术实力,能力覆盖硬件到全栈机器人。他在斯坦福跟随我做博士后时,就已经是一名横跨建模与硬件的全栈机器人研究者。昀烛的学生以及SceniX团队,补充了World Labs此前尚未拥有的人才储备。


昌熙则带来了极强的仿真能力。World Labs的工作与仿真世界有大量衔接,而SceniX相对欠缺的是生成模型和基于计算机视觉的三维重建能力,这恰好是World Labs的强项,也是SceniX所需要的技术。


双方结合后,能力版图会更加完整。


李飞飞最新访谈:人也不全靠现实数据学习啊


主持人:昀烛,在决定继续独立发展还是加入World Labs时,你如何判断双方是否契合?为什么最终作出这个决定?


李昀烛:一开始,我们考虑过继续独立发展。但与飞飞老师交流并看到双方的协同效应后,我们认为一同推进非常合理。


SceniX的real-to-sim-to-real工作涉及对环境进行稠密重建(Dense Reconstruction),包括捕捉环境的外观、几何结构和动力学,也就是施加动作后环境将如何变化。目前,稠密重建的任务仍然相对繁重。


World Labs则在稀疏重建和生成方面拥有深厚能力。我们看到很多机会,可以利用Marble及其他相关能力,更高效地完成环境重建和建模。


李飞飞最新访谈:人也不全靠现实数据学习啊


主持人:我们可以期待World Labs推出机器人基础模型吗?


李飞飞:World Labs正在构建基础模型,我们当然不排除这个方向。


李昀烛:是的。机器人基础模型本质上需要的是多模态模型。


它必须处理帧、文本、图像、深度和其他模态,而动作是其中非常关键的一种模态。如果把帧和动作作为输入,模型就可以充当模拟器,预测执行特定动作后环境将如何变化。


如果把动作当成输出,它本质上就是一个policy model,预测机器人为了接近某个具体目标,应当在真实环境中采取什么动作。


这类Omni-Model不仅可以帮助具身智能研究者与开发者更好地理解环境建模及决策规划,也可以作为基础骨干模型,针对具体机器人应用进行微调,从而达到客户所期望的可靠性和效率。


李飞飞最新访谈:人也不全靠现实数据学习啊


为什么强调三维和仿真?


主持人:目前很多机器人公司采用纯视频模型路线,而你们强调三维和仿真。两种路线有什么区别?


李昀烛:要创建机器人能够在其中工作的世界,这个世界必须捕捉问题的本质结构,其中一个必要条件就是一致性,包括空间、时间、不同视角和不同交互方式上的一致性。


我们正是在这里看到了与Marble的强协同。Marble生成的世界能够提供机器人所需基础设施的一部分。


试想,机器人尝试着把一个物体向前推,物体却离奇失踪了。许多现有视频预测模型都可能出现这类问题,这样的结果不足以给机器人提供正确行动的信号。


视频模型正在快速进步,但我们构建的基础设施可以为数据飞轮提供初始动力,使之从更偏仿真驱动的模型,逐步走向能够在真实环境中执行的机器人策略模型,再收集新数据并反馈回来。


模型不必只依靠物理,也不必只依靠学习。它可以位于两者之间,既捕捉问题的本质结构,又能随着数据积累不断扩展和改进。


主持人:飞飞长期以来一直有一个围绕三维与空间智能的理念“北极星”。你是否也有类似的理念?还是会更务实,先把系统做出来、再让它运行?


李昀烛:我的北极星就是让机器人在真实的环境中工作。我是一个非常务实的人。


在跟随飞飞老师做博士后期间,我们合作构建过一项benchmark,并向公众调查他们希望机器人替自己做什么。在我们收集的一千多项任务中,有三分之一与清洁有关。人们不喜欢这些脏活累活,而这些正是我们希望用机器人解决的场景。


李飞飞:我真正欣赏的是SceniX联合创始人们极其务实的工作方法。


尽管他们大多来自学术界,但还是第一时间选择了与真实产业中的设计者和客户合作,进入实验室、仓库和电子装配等真实场景。


这种研发机器人的方式令人耳目一新,也让我非常期待与他们合作。


李飞飞最新访谈:人也不全靠现实数据学习啊


主持人:机器人系统必须相当精确,但创意应用可以容忍和接受错误,有时候甚至错误反而会成为创意的缪斯。从技术角度看,昀烛觉得该如何协调这两种要求?


李昀烛:我觉得两者可以协调起来。环境模型不必完美,机器人模型也不必完美。


主持人:模型不必完美,具体是什么意思?它至少仍要非常接近现实吧?


李昀烛:模型一直是多种机器人应用发展的重要基石。无人机、扫地机器人、四足机器人和双足机器人,都需要依赖模型才能工作,并从模拟环境迁移到真实环境。


运动机器人可以在雪地或灌木丛中行走,但模拟器并不需要精确复刻每一处灌木和积雪。


仿真需要捕捉问题的本质结构,并在数字环境中支持不同形式的随机化。


我们正在研究,应当以怎样的保真度对机器人周围的世界建模,才能让在模拟环境和数字世界中训练的机器人系统迁移回真实场景。


李飞飞最新访谈:人也不全靠现实数据学习啊 原文链接: https://www.aitntnews.com/newDetail.html?newId=28022