
🚥 本周「十字路口」的嘉宾是清华叉院助理教授徐梦迪。从清华车辆工程出发,途经 Johns Hopkins、CMU,再到 Stanford 吴佳俊、李飞飞组做博士后,2024 年初她选择回国,加入清华交叉信息研究院。她的核心命题是机器人的 In-Context Learning (ICL):让机器人到一个新环境,通过一两次交互当场学会新任务,而且越学越快。
本期节目还有一个及时的注脚:就在我们录完节目后的第二周,Generalist 发布 GEN-1.5 ——只给机器人看一段 3-12 秒的动作示范作为 "physical prompt",不做微调、不更新参数,它就能当场尝试完成新任务(10 项任务平均成功率约 59%)。ICL 随即成为全球具身智能领域最受关注的话题之一,而这正是梦迪持续押注的方向。
除了 ICL,我们还聊到:
•预训练的天花板
•真正的泛化
•Scaling Law 的信号与陷阱
•跑通稳定的数据闭环
•叠衣服 demo 的误导
•行业的泡沫与进步
•年轻 PI 的真实生活与研究选择
穿越所有的技术话题之后,这还是一期关于人生选择、环境与长期主义的对话,希望可以是给所有站在中美之间、学术与产业之间、跟随热点与坚持长线之间的年轻人的一份参考。
微信收听播客:

小宇宙收听播客:

🎬 视频播客已同步上线于 @Koji杨远骋 的视频号、小红书、哔哩哔哩、Youtube 等平台



快问快答
👦🏻 Koji
我们先从传统快问快答开始,帮助大家了解你。梦迪你的年龄?
👩🏻 徐梦迪
我今年 30.5 岁。
👦🏻 Koji
30.5?这么精确!MBTI 和星座?
👩🏻 徐梦迪
我的 MBTI 是 INTJ,星座是摩羯。
👦🏻 Koji
一句话介绍你当前花时间最多的研究方向是什么?
👩🏻 徐梦迪
让机器人能够从现实场景当中,不断地持续提升自己。
👦🏻 Koji
这个做了多久?我记得很早之前你就在做泛化。
👩🏻 徐梦迪
在 CMU 之后,我其实就一直在沿着泛化的方向做。
当时觉得机器人不能只依赖预先学到的知识。人类之所以有这么强的泛化性,有两个层面:一是人有很多先验知识;二是人学新知识学得非常快。真正的泛化,是希望让机器人具备类似人类这种快速学习的能力。
👦🏻 Koji
当时是什么契机让你进入这个研究方向的?
👩🏻 徐梦迪
到 CMU 之后,我开始做当时叫 Robot Learning 的方向,把机器学习的方法用到机器人上,当时还不叫具身智能这个 fancy 的名字。
我在 CMU 时非常喜欢一个工作叫 MAML,是 Stanford 教授、Physical Intelligence 联合创始人 Chelsea Finn 非常有名的一项成果。MAML 厉害的地方在于,它能让机器人学到没见过的任务。我当时觉得这才是机器人未来的方向。
👦🏻 Koji
当时是怎么关注到这个工作的?
👩🏻 徐梦迪
当时这个工作非常有名,实验室有同学对 ML 前沿方向都很感兴趣,大家平时经常交流、分享文章。我们看的论文非常杂,就注意到了这个方向。
衡水, 清华, JHU, CMU, 斯坦福
👦🏻 Koji
清华本科你读的是车辆工程系,从车辆工程到具身智能,中间感觉隔着一个“变形金刚”,你是怎么转型的?
👩🏻 徐梦迪
本科我学的是汽车,专业叫车辆工程。现在回想,当时去汽车系是一个非常正确的选择,汽车系学得非常全面:机械设计、汽车电子,跟电子系交叉很强,还有很多算法课程。从机械设计到算法,本科时都有所涉猎。
真正转向 Robotics 的契机在大二。当时我跟着机械系的阎绍泽老师做科研,做 Bio Robotics,研究蜜蜂翅膀的超弹性恢复。蜜蜂在采蜜过程中,翅膀会频繁与周围环境碰撞,但翅膀不会受损,因为它在结构上具有超弹性的性质。
以此为契机,大三暑研我去了 CMU Howie Choset 教授的组,他们组非常有名的方向就是 Bio Robotics。我在那里设计了一个爬管子的蛇形机器人,从那会儿开始,工作重心从机械设计逐渐转向了机器人算法。
👦🏻 Koji
这应该不是车辆工程系学生的常规路径吧?
👩🏻 徐梦迪
汽车系学生有个特点:自己想做的事情,就会非常努力去找跟兴趣 match 的地方。
当时有一些学长在阎绍泽老师组里,包括现在在哈佛做 AP 的杨珩学长,还有我高中一起学竞赛的同学也在,阴差阳错,我非常幸运地进了阎老师的组。
👦🏻 Koji
说到高中竞赛,你在中学甚至小学阶段是怎样的经历?一路都是学霸吗?
👩🏻 徐梦迪
我特别不敢称自己是学霸。后来求学、出国,见过太多厉害的人,大家都有非常独特的想法。学不学霸,无非是有人把精力放在学业上,有人放在了更感兴趣的事情上。
我小学过得挺轻松的,没上过补习班,课余时间要么参加学校活动,要么跟朋友玩。

👦🏻 Koji
我记得你的高中是衡水中学?
👩🏻 徐梦迪
对,衡中。小学时家里给的环境比较宽松,过得很快乐。当时有个爱好是拼四驱车,赶上动漫《四驱兄弟》大火,买零件自己拼,拼车很费钱,我们还琢磨着怎么赚钱。
👦🏻 Koji
玩四驱车还能赚钱?
👩🏻 徐梦迪
大院里好几个小朋友都喜欢,大家就想办法搞钱买车。
👦🏻 Koji
怎么赚呢?
👩🏻 徐梦迪
放学路上捡废品卖掉,其实还蛮赚钱。
👦🏻 Koji
听起来很像城市寻宝游戏,但是什么样的废品能卖到买四驱车的钱呢?
👩🏻 徐梦迪
一些废弃的钢铁零件,会有人回收。现在想想,小时候找零件还挺有毅力的。
👦🏻 Koji
感觉很小就埋下了车辆工程的种子?
👩🏻 徐梦迪
确实是我后来选车辆工程的原因之一。我一直觉得机械结构特别酷,能把很多细小的零件组装在一起,凝结了几代工匠的知识积累,变成一台精密的仪器。
👦🏻 Koji
在衡水中学的体验是什么样的?
👩🏻 徐梦迪
我自己的体验挺好的。高中的时候我是竞赛生,主业是搞竞赛,跟高考班的管理要求不太一样。竞赛更需要激发自主的 motivation,所以课程节奏跟普通班不同。
👦🏻 Koji
你是怎么成为竞赛生的呢?
👩🏻 徐梦迪
高一第一学期结束时会有意向调研,老师会来问对哪科感兴趣。当时我在数学和物理之间挑,觉得物理是一个非常 ground 到现实世界的学科,就选了物理。
👦🏻 Koji
听说衡中早上 5 点多、6 点就要起床,作息精细到几分钟。我听说甚至一个礼拜只有一次洗澡机会?
👩🏻 徐梦迪
不管是高考班还是竞赛班,作息要求都很一致:早操、上午操,时间表极其严格,高一到高三错峰去食堂。管理上确实非常严苛。
👦🏻 Koji
外面对衡水模式讨论很多,大家很好奇衡水毕业生的未来发展?你的观察是什么?
👩🏻 徐梦迪
以竞赛班来说,大家的特点是每个人都有极其强烈的个人想法。竞赛需要巨大的时间 commitment,因为别人放寒暑假,我们也在搞集训。我们班同学,一部分出国成了优秀的 Researcher,一部分在国内发展得也很好。
👦🏻 Koji
当时选择竞赛路线,是不是也像是选择了一条不归路?
👩🏻 徐梦迪
会有这种感觉。你不可能像其他高考学生那样面面俱到地学所有科目。一路经历竞赛考试、保送、自招,直到确定没有保送机会了,才会 merge 进普通高考班,但那时已经到高三下学期了。
👦🏻 Koji
有点像创业,需要破釜沉舟。
👩🏻 徐梦迪
对,但当时觉得非常有意思、有干劲。身边的朋友目标高度一致,小到解出一道题,大到冲省一、拿金牌,motivation 极强,完全不觉得苦。
👦🏻 Koji
同学之间竞争强吗?
👩🏻 徐梦迪
竞争肯定存在,但教练引导得很好。在班级里大家更像是并肩作战的同伴。所有人从零开始抱团解决问题,这种战友式的情谊比竞争坚固得多。
不能只靠预训练
👦🏻 Koji
在 CMU 读机械工程时,你的拿了系里的最佳 PhD 论文奖。这个奖一年发出多少个?
👩🏻 徐梦迪
我们那一届是两个人。
👦🏻 Koji
那篇论文的核心内容是什么?
👩🏻 徐梦迪
题目叫《Building Adaptable Generalist Robots》。核心是希望让机器人具备适应动态变化环境的能力。
预训练当然有用,我也非常相信 scaling,但预训练不是全部。我们不能指望机器人光靠预训练就变成一个 100% 成功的全能个体,它进入真实环境必须适应具体的变化。
现实是开放世界,任务在不断变化:家里今天有 20 个物体,一周后可能有 30 个,品类完全不同;不同人在不同场景下的 preference 也在变。对应到机器人的能力上,必须能够适应变化,并在变化中自我迭代。
👦🏻 Koji
当时主要的解题路径是什么?
👩🏻 徐梦迪
主要是两条路:
第一条是 In-Context Learning,上下文学习;第二条是 Test-Time Training,在部署时调整一小部分模型参数。目标都是让机器人摆脱单纯对 Pre-training 的依赖,通过 context 和 interaction 在现实场景中持续学习。
In-Context Learning 这条线,源于我 2021 年做的工作 Prompt Decision Transformer。当时的 motivation 是看到了 GPT-3 的上下文学习能力。我觉得太酷了——传统的 ML 是遇到新任务就做 Fine-tuning,而 GPT-3 是给一个 prompt 或输出格式,模型根据 prompt 直接调整输出。这种 adaptation 方式高效直接,不需要在部署端重新训练。当时我就想,机器人能不能也具备这种能力?
Prompt Decision Transformer 从相对基础的 setting 切入:给模型一段机器人的 demonstration,让它快速 adapt 到不同的 locomotion 和 manipulation 任务。
第二项工作是它的续作,Hyper-Decision Transformer,走的是 Test-Time Training 的路子。在部署阶段调整参数是一把双刃剑:调了参数能解决当前任务,但调多了又会遗忘预训练知识。我们折中做了一个 Hypernetwork,将元知识注入其中,再由它生成一个只占整体 Transformer 0.5% 参数量的小 Adapter。部署时只需要更新这 0.5% 的参数。
👦🏻 Koji
实测效果怎么样?
👩🏻 徐梦迪
在小样本预训练的前提下,Hypernetwork 更容易见效。
但随着现在数据量和预训练规模的大幅积累,我认为未来的核心方向依然是 In-Context Learning。通过 prompting 的方式解决,不用频繁改参数;或者等收集到足够多的 multi-task 数据后,再做批量的参数更新。
👦🏻 Koji
你现在推进的工作,相比当时有哪些延伸?
👩🏻 徐梦迪
做完 Prompt Decision Transformer 之后,业内利用 In-Context Learning 做快速 adaptation 的工作多了很多。
DeepMind 有个工作叫 Algorithm Distillation,视角非常惊艳:模型到底应该等价于一种什么样的智能?
现在大家用 VLA,是将模型参数等价于任务知识的载体,把专家 demonstration 通过模仿学习 distill 到参数里;而 Algorithm Distillation 认为,模型参数应该等价于一个算法,等价于一个 RL algorithm。它把 suboptimal 的轨迹放入 context window,让模型根据过去的失误动作和历史不断修正未来的 action。Transformer 结构由此具备了自我提升能力,参数本身就是一个强化学习算法。
👦🏻 Koji
这项工作在真机上验证过吗?
👩🏻 徐梦迪
在模拟器里跑通了,但任务更偏 navigation 和 locomotion,比如走迷宫。用在 manipulation 上依然很难。
类似的工作还有 Skild 团队的 LocoFormer,用 Transformer 基于 In-Context Learning 做腿足机器人的 adaptation,也是偏 locomotion。还有英伟达最近的 RoboTTT,让机器人观察人类长程 manipulation 视频,通过 TTT layer 改变 behavior,复现出类似演示里的动作。

👦🏻 Koji
大家的解法听起来还挺发散的,有收敛的迹象吗?
👩🏻 徐梦迪
业内对 adaptation 的重视度明显高起来了。
大家逐渐意识到,仅靠海量数据和海量参数预训练,或者单纯依靠基于专家演示的模仿学习,无法彻底解决机器人应用。在此基础上的 adaptation 成了破局点,这个共识正在形成。
👦🏻 Koji
我觉得这听起来好像是顺理成章、理所当然的事,为什么到现在才变成核心共识呢?
👩🏻 徐梦迪
业内一直有争论。人类之所以泛化能力强,原因有二:一是漫长演化带来的深厚先验与小脑控制力;二是人类新学一项技能的速度极快。
此前的主流做法是通过 scale 数据和模型,先把机器人的 prior 做厚,强化 multi-task 和 instruction following 能力,这并不意味着 adaptation 不重要。
但在真实场景中,机器人如果只有自适应