“我看到了 Scaling Law 的信号” | 对谈清华叉院助理教授徐梦迪:具身智能、世界模型、真正的泛化


🚥 本周「十字路口」的嘉宾是清华叉院助理教授徐梦迪。从清华车辆工程出发,途经 Johns Hopkins、CMU,再到 Stanford 吴佳俊、李飞飞组做博士后,2024 年初她选择回国,加入清华交叉信息研究院。她的核心命题是机器人的 In-Context Learning (ICL):让机器人到一个新环境,通过一两次交互当场学会新任务,而且越学越快。


本期节目还有一个及时的注脚:就在我们录完节目后的第二周,Generalist 发布 GEN-1.5 ——只给机器人看一段 3-12 秒的动作示范作为 "physical prompt",不做微调、不更新参数,它就能当场尝试完成新任务(10 项任务平均成功率约 59%)。ICL 随即成为全球具身智能领域最受关注的话题之一,而这正是梦迪持续押注的方向。


除了 ICL,我们还聊到:


•预训练的天花板


•真正的泛化


•Scaling Law 的信号与陷阱


•跑通稳定的数据闭环


•叠衣服 demo 的误导


•行业的泡沫与进步


•年轻 PI 的真实生活与研究选择


穿越所有的技术话题之后,这还是一期关于人生选择、环境与长期主义的对话,希望可以是给所有站在中美之间、学术与产业之间、跟随热点与坚持长线之间的年轻人的一份参考。


微信收听播客:


“我看到了 Scaling Law 的信号” | 对谈清华叉院助理教授徐梦迪:具身智能、世界模型、真正的泛化


小宇宙收听播客:


“我看到了 Scaling Law 的信号” | 对谈清华叉院助理教授徐梦迪:具身智能、世界模型、真正的泛化


🎬 视频播客已同步上线于 @Koji杨远骋 的视频号、小红书、哔哩哔哩、Youtube 等平台


“我看到了 Scaling Law 的信号” | 对谈清华叉院助理教授徐梦迪:具身智能、世界模型、真正的泛化


“我看到了 Scaling Law 的信号” | 对谈清华叉院助理教授徐梦迪:具身智能、世界模型、真正的泛化


“我看到了 Scaling Law 的信号” | 对谈清华叉院助理教授徐梦迪:具身智能、世界模型、真正的泛化


快问快答


👦🏻 Koji


我们先从传统快问快答开始,帮助大家了解你。梦迪你的年龄?


👩🏻 徐梦迪


我今年 30.5 岁。


👦🏻 Koji


30.5?这么精确!MBTI 和星座?


👩🏻 徐梦迪


我的 MBTI 是 INTJ,星座是摩羯。


👦🏻 Koji


一句话介绍你当前花时间最多的研究方向是什么?


👩🏻 徐梦迪


让机器人能够从现实场景当中,不断地持续提升自己。


👦🏻 Koji


这个做了多久?我记得很早之前你就在做泛化。


👩🏻 徐梦迪


在 CMU 之后,我其实就一直在沿着泛化的方向做。


当时觉得机器人不能只依赖预先学到的知识。人类之所以有这么强的泛化性,有两个层面:一是人有很多先验知识;二是人学新知识学得非常快。真正的泛化,是希望让机器人具备类似人类这种快速学习的能力。


👦🏻 Koji


当时是什么契机让你进入这个研究方向的?


👩🏻 徐梦迪


到 CMU 之后,我开始做当时叫 Robot Learning 的方向,把机器学习的方法用到机器人上,当时还不叫具身智能这个 fancy 的名字。


我在 CMU 时非常喜欢一个工作叫 MAML,是 Stanford 教授、Physical Intelligence 联合创始人 Chelsea Finn 非常有名的一项成果。MAML 厉害的地方在于,它能让机器人学到没见过的任务。我当时觉得这才是机器人未来的方向。


👦🏻 Koji


当时是怎么关注到这个工作的?


👩🏻 徐梦迪


当时这个工作非常有名,实验室有同学对 ML 前沿方向都很感兴趣,大家平时经常交流、分享文章。我们看的论文非常杂,就注意到了这个方向。


衡水, 清华, JHU, CMU, 斯坦福


👦🏻 Koji


清华本科你读的是车辆工程系,从车辆工程到具身智能,中间感觉隔着一个“变形金刚”,你是怎么转型的?


👩🏻 徐梦迪


本科我学的是汽车,专业叫车辆工程。现在回想,当时去汽车系是一个非常正确的选择,汽车系学得非常全面:机械设计、汽车电子,跟电子系交叉很强,还有很多算法课程。从机械设计到算法,本科时都有所涉猎。


真正转向 Robotics 的契机在大二。当时我跟着机械系的阎绍泽老师做科研,做 Bio Robotics,研究蜜蜂翅膀的超弹性恢复。蜜蜂在采蜜过程中,翅膀会频繁与周围环境碰撞,但翅膀不会受损,因为它在结构上具有超弹性的性质。


以此为契机,大三暑研我去了 CMU Howie Choset 教授的组,他们组非常有名的方向就是 Bio Robotics。我在那里设计了一个爬管子的蛇形机器人,从那会儿开始,工作重心从机械设计逐渐转向了机器人算法。


👦🏻 Koji


这应该不是车辆工程系学生的常规路径吧?


👩🏻 徐梦迪


汽车系学生有个特点:自己想做的事情,就会非常努力去找跟兴趣 match 的地方。


当时有一些学长在阎绍泽老师组里,包括现在在哈佛做 AP 的杨珩学长,还有我高中一起学竞赛的同学也在,阴差阳错,我非常幸运地进了阎老师的组。


👦🏻 Koji


说到高中竞赛,你在中学甚至小学阶段是怎样的经历?一路都是学霸吗?


👩🏻 徐梦迪


我特别不敢称自己是学霸。后来求学、出国,见过太多厉害的人,大家都有非常独特的想法。学不学霸,无非是有人把精力放在学业上,有人放在了更感兴趣的事情上。


我小学过得挺轻松的,没上过补习班,课余时间要么参加学校活动,要么跟朋友玩。


“我看到了 Scaling Law 的信号” | 对谈清华叉院助理教授徐梦迪:具身智能、世界模型、真正的泛化


👦🏻 Koji


我记得你的高中是衡水中学?


👩🏻 徐梦迪


对,衡中。小学时家里给的环境比较宽松,过得很快乐。当时有个爱好是拼四驱车,赶上动漫《四驱兄弟》大火,买零件自己拼,拼车很费钱,我们还琢磨着怎么赚钱。


👦🏻 Koji


玩四驱车还能赚钱?


👩🏻 徐梦迪


大院里好几个小朋友都喜欢,大家就想办法搞钱买车。


👦🏻 Koji


怎么赚呢?


👩🏻 徐梦迪


放学路上捡废品卖掉,其实还蛮赚钱。


👦🏻 Koji


听起来很像城市寻宝游戏,但是什么样的废品能卖到买四驱车的钱呢?


👩🏻 徐梦迪


一些废弃的钢铁零件,会有人回收。现在想想,小时候找零件还挺有毅力的。


👦🏻 Koji


感觉很小就埋下了车辆工程的种子?


👩🏻 徐梦迪


确实是我后来选车辆工程的原因之一。我一直觉得机械结构特别酷,能把很多细小的零件组装在一起,凝结了几代工匠的知识积累,变成一台精密的仪器。


👦🏻 Koji


在衡水中学的体验是什么样的?


👩🏻 徐梦迪


我自己的体验挺好的。高中的时候我是竞赛生,主业是搞竞赛,跟高考班的管理要求不太一样。竞赛更需要激发自主的 motivation,所以课程节奏跟普通班不同。


👦🏻 Koji


你是怎么成为竞赛生的呢?


👩🏻 徐梦迪


高一第一学期结束时会有意向调研,老师会来问对哪科感兴趣。当时我在数学和物理之间挑,觉得物理是一个非常 ground 到现实世界的学科,就选了物理。


👦🏻 Koji


听说衡中早上 5 点多、6 点就要起床,作息精细到几分钟。我听说甚至一个礼拜只有一次洗澡机会?


👩🏻 徐梦迪


不管是高考班还是竞赛班,作息要求都很一致:早操、上午操,时间表极其严格,高一到高三错峰去食堂。管理上确实非常严苛。


👦🏻 Koji


外面对衡水模式讨论很多,大家很好奇衡水毕业生的未来发展?你的观察是什么?


👩🏻 徐梦迪


以竞赛班来说,大家的特点是每个人都有极其强烈的个人想法。竞赛需要巨大的时间 commitment,因为别人放寒暑假,我们也在搞集训。我们班同学,一部分出国成了优秀的 Researcher,一部分在国内发展得也很好。


👦🏻 Koji


当时选择竞赛路线,是不是也像是选择了一条不归路?


👩🏻 徐梦迪


会有这种感觉。你不可能像其他高考学生那样面面俱到地学所有科目。一路经历竞赛考试、保送、自招,直到确定没有保送机会了,才会 merge 进普通高考班,但那时已经到高三下学期了。


👦🏻 Koji


有点像创业,需要破釜沉舟。


👩🏻 徐梦迪


对,但当时觉得非常有意思、有干劲。身边的朋友目标高度一致,小到解出一道题,大到冲省一、拿金牌,motivation 极强,完全不觉得苦。


👦🏻 Koji


同学之间竞争强吗?


👩🏻 徐梦迪


竞争肯定存在,但教练引导得很好。在班级里大家更像是并肩作战的同伴。所有人从零开始抱团解决问题,这种战友式的情谊比竞争坚固得多。


不能只靠预训练


👦🏻 Koji


在 CMU 读机械工程时,你的拿了系里的最佳 PhD 论文奖。这个奖一年发出多少个?


👩🏻 徐梦迪


我们那一届是两个人。


👦🏻 Koji


那篇论文的核心内容是什么?


👩🏻 徐梦迪


题目叫《Building Adaptable Generalist Robots》。核心是希望让机器人具备适应动态变化环境的能力。


预训练当然有用,我也非常相信 scaling,但预训练不是全部。我们不能指望机器人光靠预训练就变成一个 100% 成功的全能个体,它进入真实环境必须适应具体的变化。


现实是开放世界,任务在不断变化:家里今天有 20 个物体,一周后可能有 30 个,品类完全不同;不同人在不同场景下的 preference 也在变。对应到机器人的能力上,必须能够适应变化,并在变化中自我迭代。


👦🏻 Koji


当时主要的解题路径是什么?


👩🏻 徐梦迪


主要是两条路:


第一条是 In-Context Learning,上下文学习;第二条是 Test-Time Training,在部署时调整一小部分模型参数。目标都是让机器人摆脱单纯对 Pre-training 的依赖,通过 context 和 interaction 在现实场景中持续学习。


In-Context Learning 这条线,源于我 2021 年做的工作 Prompt Decision Transformer。当时的 motivation 是看到了 GPT-3 的上下文学习能力。我觉得太酷了——传统的 ML 是遇到新任务就做 Fine-tuning,而 GPT-3 是给一个 prompt 或输出格式,模型根据 prompt 直接调整输出。这种 adaptation 方式高效直接,不需要在部署端重新训练。当时我就想,机器人能不能也具备这种能力?


Prompt Decision Transformer 从相对基础的 setting 切入:给模型一段机器人的 demonstration,让它快速 adapt 到不同的 locomotion 和 manipulation 任务。


第二项工作是它的续作,Hyper-Decision Transformer,走的是 Test-Time Training 的路子。在部署阶段调整参数是一把双刃剑:调了参数能解决当前任务,但调多了又会遗忘预训练知识。我们折中做了一个 Hypernetwork,将元知识注入其中,再由它生成一个只占整体 Transformer 0.5% 参数量的小 Adapter。部署时只需要更新这 0.5% 的参数。


👦🏻 Koji


实测效果怎么样?


👩🏻 徐梦迪


在小样本预训练的前提下,Hypernetwork 更容易见效。


但随着现在数据量和预训练规模的大幅积累,我认为未来的核心方向依然是 In-Context Learning。通过 prompting 的方式解决,不用频繁改参数;或者等收集到足够多的 multi-task 数据后,再做批量的参数更新。


👦🏻 Koji


你现在推进的工作,相比当时有哪些延伸?


👩🏻 徐梦迪


做完 Prompt Decision Transformer 之后,业内利用 In-Context Learning 做快速 adaptation 的工作多了很多。


DeepMind 有个工作叫 Algorithm Distillation,视角非常惊艳:模型到底应该等价于一种什么样的智能?


现在大家用 VLA,是将模型参数等价于任务知识的载体,把专家 demonstration 通过模仿学习 distill 到参数里;而 Algorithm Distillation 认为,模型参数应该等价于一个算法,等价于一个 RL algorithm。它把 suboptimal 的轨迹放入 context window,让模型根据过去的失误动作和历史不断修正未来的 action。Transformer 结构由此具备了自我提升能力,参数本身就是一个强化学习算法。


👦🏻 Koji


这项工作在真机上验证过吗?


👩🏻 徐梦迪


在模拟器里跑通了,但任务更偏 navigation 和 locomotion,比如走迷宫。用在 manipulation 上依然很难。


类似的工作还有 Skild 团队的 LocoFormer,用 Transformer 基于 In-Context Learning 做腿足机器人的 adaptation,也是偏 locomotion。还有英伟达最近的 RoboTTT,让机器人观察人类长程 manipulation 视频,通过 TTT layer 改变 behavior,复现出类似演示里的动作。


“我看到了 Scaling Law 的信号” | 对谈清华叉院助理教授徐梦迪:具身智能、世界模型、真正的泛化


👦🏻 Koji


大家的解法听起来还挺发散的,有收敛的迹象吗?


👩🏻 徐梦迪


业内对 adaptation 的重视度明显高起来了。


大家逐渐意识到,仅靠海量数据和海量参数预训练,或者单纯依靠基于专家演示的模仿学习,无法彻底解决机器人应用。在此基础上的 adaptation 成了破局点,这个共识正在形成。


👦🏻 Koji


我觉得这听起来好像是顺理成章、理所当然的事,为什么到现在才变成核心共识呢?


👩🏻 徐梦迪


业内一直有争论。人类之所以泛化能力强,原因有二:一是漫长演化带来的深厚先验与小脑控制力;二是人类新学一项技能的速度极快。


此前的主流做法是通过 scale 数据和模型,先把机器人的 prior 做厚,强化 multi-task 和 instruction following 能力,这并不意味着 adaptation 不重要。


但在真实场景中,机器人如果只有自适应