2020年,GPT-3靠“看几个示例就会新任务”震动了NLP界;六年后的今天,同样的故事正在具身智能领域上演。
没错,就是In-Context Learning。
8月中旬,Skild AI发布机器人基础模型S1。只需要给机器人看一遍任务演示视频,它可以在不微调、不做额外post-training的情况下,尝试完成此前没有训练过的新任务。任务时长可达10分钟,包含几十个操作步骤。
Skild在(训练数据)见过的任务和未见过的任务上,对比了ICL视频Prompt和传统的语言Prompt VLA。
测试结果表明,当训练数据只有1000小时时,语言Prompt效果更好,而随着数据规模增加,ICL开始反超。对于未见任务,加入视频context后,模型表现相比只用语言指令提升约7倍。

S1发布的一周之前,Generalist AI发布GEN-1.5,同样把One-Shot Learning作为核心能力。机器人只看一个示范,就能在数秒内学习新任务,无需梯度更新或微调,并支持人类示范到机器人执行、组合泛化和Sim-to-Real迁移。
这两项进展都是在尝试让机器人学会利用更长的多模态Context。
In-Context Learning(ICL)这条路径,已经在LLM领域被验证、并成为至关重要的一环。
2020年,OpenAI在GPT-3的论文Language Models are Few‑Shot Learners中提出ICL,定义它是一种能力——不给模型做任何参数更新(没有微调、反向传播训练),仅在输入prompt中提供若干任务示例(demonstrations/examples),模型在单次前向推理过程中就能够识别并执行该新任务。

过去三年,上下文从4K扩展到1M,让模型能一口气处理一整本书、一个代码库,背后的主要引擎就是ICL。
与LLM不同,具身模型面对的是视觉观测、语言指令与动作序列交织的复合上下文,且真实任务是非马尔可夫的——“接下来做什么”取决于“几分钟前做过什么”。
简单来说,具身模型面对的上下文是每秒几十帧视觉观测,外加本体状态与动作序列,信息量高出几个数量级。
直到今年7月16日,才有李飞飞、Jim Fan、Yuke Zhu等合著的机器人长上下文策略模型与训练方案RoboTTT,第一次系统地把“上下文 scaling”这条路线搬到机器人视觉运动策略上。
8月,Generalist和Skild发布成果。
虽然两家公司仅以成果发布形式展示模型效果,技术细节没有完整公开,但在具身领域,关于ICL讨论度随即骤升。
这条路能否在具身领域真正跑通,取决于一系列远未解决的技术问题。
也正因为如此,我们产生了更具体的好奇:
如果具身智能真的要沿着Long Context和ICL继续往前走,机器人究竟要怎样理解如此复杂的上下文?
示范、语言、历史动作甚至人的纠正,又该怎样进入模型?
于是,我们找到了可可矩阵(COCO Matrix),一家致力于把In-Context Learning做成具身智能的底层范式的国内创业公司。
这家公司成立于2026年4月。
不过创始人兼CEO高宇翔告诉我,今年1月深入讨论创业相关事宜时,他和自己的co-founder就一致认为是时候着手押注ICL了。
高宇翔今年30岁,西安交大少年班出身,约翰斯·霍普金斯大学(JHU)博士辍学,在读期间做人机交互研究。
高宇翔说,GPT-3展现出上下文学习能力时,还在JHU读博的他就已经在琢磨,这种“不给参数更新、只看示例就会新任务”的能力能不能搬到机器人身上?
此后五年,他辍学、回国创业、加入工业界、再次创业。
这期间,高宇翔在傅利叶带队打通了全尺寸人形机器人从遥操作、数据采集到模型部署的完整链路,并在2025年5至8月用一百多万成本,在全尺寸双足人形上训练出具备一定泛化能力的世界模型。

https://about.yuxiang.io/
今年4月,可可矩阵正式成立,开始把当年在学校里就开始接触的问题变成了创业方向。
与Generalist、Skild不一样,可可矩阵的思路是把后训练的ICL前置到预训练阶段。
于是,围绕具身ICL的技术进展、落地难题与行业争议等,我与高宇翔在上海进行了一场深度对谈。
(以下是对话实录,在不影响本意的前提下略有删改)
为什么具身智能需要换一条Scaling路线?
量子位:过去很长一段时间,具身智能都沿着大模型的路线Scale数据。大家为什么相信,堆更多数据就能把机器人能力Scale起来?
高宇翔:最开始整个行业的心态其实都比较乐观。
早期像ACT、Diffusion Policy这些方案跑通之后,基本解决了behavior cloning、模仿学习的很多核心问题。
当时大家很自然地延续大语言模型的成功逻辑,只要持续扩充数据,数据量积累到一定阈值,模型就能涌现出通用能力,最终实现全方位的任务适配。
放在当时的行业环境里这个思路本身没有问题,所以整个行业都开始全力规模化扩充数据。
量子位:后来问题出在哪里?
高宇翔:针对单一任务,现在采集两百条左右的数据,就可以把任务拟合得很好,一个新任务从演示到模型适配,大概十八个小时就能完成。
但继续增加数据之后,模型一直没有出现大家期待的通用泛化能力。
同时,具身数据本身也很难Scale。遥操作数据的质量并不统一,物品和场景多样性有限,单纯依靠这类数据,很难提供足够丰富的感知覆盖。
量子位:除了这个,还有哪些其它的问题呢?
高宇翔:早期很多VLA沿用了LLM、VLM的预训练体系,但面向物理世界时,原有视觉表征很难同时覆盖机器人需要的不同层级信息,因此不少方案需要不断拼接不同的视觉模块。
这套路线在很多场景下依然有效,但过去一年多大家逐渐发现,继续沿着原有VLA范式叠数据、叠模块,后续能力提升会越来越困难。
具身智能Scaling路线的新尝试
量子位:如果数据覆盖走不通,行业现在开始Scale什么?
高宇翔:能明显感觉到大家开始关注机器人的学习能力和适应能力。
过去更关注模型在训练阶段见过多少数据、学会多少任务。现在大家开始问另一个问题,机器人到了一个从来没有见过的新环境、新任务里,能不能利用当前的Context快速学会。
今年已经出现了一些很明显的信号。
像RoboTTT这类工作,在尝试解决更长历史信息的编码、压缩和利用,让机器人能够持续参考更长时间的视觉和动作Context。

Generalist AI、Skild AI最近展示的One-Shot能力更进一步。给机器人看一次任务示范,它就可以基于这段Context快速适配新任务,不需要为每个任务重新做完整的微调或训练。
所以现在具身智能的Scaling维度正在发生扩展。
除了继续Scale模型、数据和任务覆盖之外,机器人在部署之后还能不能继续学习,能不能从示范、历史经验和交互过程中快速获得新能力,也开始成为一个新的Scaling方向。
LLM验证过的Scaling逻辑,怎么到了具身领域这么难?
量子位:同样是ICL,具身领域的难度好像比语言模型领域的难度高很多……到底复杂在哪些地方?
高宇翔:机器人面对的是物理世界,它的输入和任务结构比纯语言复杂得多。
这种复杂性主要集中在两大维度,一是模型本身的输入输出与技术架构问题,二是数据体系的先天短板问题。
可以进一步拆成三个核心技术难点。
首先是视觉理解。
机器人在不同任务、不同动作阶段,需要的信息层级并不一样。它既要理解“这是什么”这样的高层语义,也要获得位置、深度、轮廓等和动作直接相关的精细空间信息。
这也是早期很多VLA需要同时拼接DINO、CLIP这类不同视觉模型的原因。单一视觉编码器很难完整覆盖机器人需要的信息。
第二是多模态。
语言对机器人来说远远不够。视觉可能承担大部分信息,但触觉、听觉、本体感知同样会影响动作。
问题在于这些模态的数据量差异非常大,目前视觉和语言还能依靠海量数据做预训练对齐,触觉、声音和本体状态的数据规模远远没有达到这个程度。
第三个问题就是Long Context和Memory。
机器人执行的是连续任务,它需要知道之前发生过什么,还要判断过去哪些信息和现在有关。这个过程涉及历史信息的压缩、筛选、提取和长期保留。
实际上,这些支撑机器人长时记忆的基础技术,也就是最近半年左右才开始出现比较明显的进展。

从固定窗口到流式记忆
量子位:上个月底Skild‑AI的S1模型支持最长10分钟级别的长任务示范。对比Generalist GEN‑1.5的one‑shot ICL示范视频仅3‑12秒,放在30s窗口内完成现学现用。
虽然Skild给出的是示范demo,但这个时长还是太夸张了。
高宇翔:我觉得不能单纯看时长,更重要的是信息密度。
如果一段10分钟的视频里都是重复动作,没有新的任务信息,那它对模型来说并不是高质量Context。
我们现在测试效果比较好的,是人类第一视角或者第三视角的一整段完整任务演示。
人做一遍新任务,机器人看完后,在当前场景里按照这个任务再完成一次,这种One-Shot Adaptation的信息密度就很高,因为里面包含了完整的新任务逻辑、动作和场景信息。
相反,如果10分钟只是很多重复动作,或者是几个简单小任务拼起来,它的学习价值反而有限。

量子位:所以Long Context的重点,也不是把固定窗口从一分钟硬拉到十分钟?
高宇翔:对。
真实机器人任务里,很多有效Context可能也就是两三分钟。单纯让机器人每次都重新看完整的十分钟历史,没有太大必要。
更重要的是新的Context不断进入以后,模型能够持续筛选和压缩历史信息。有些最后保留下来的有效信息可能来自十分钟前,也可能来自一小时前。
我们理解的Long Context,更接近一种流式机制。
最终希望做到机器人可以持续工作、持续利用过去经验,而不会因为固定Context Window耗尽,一到下午就把早上学到的东西全部忘掉。
量子位:但模型本身的显存和Context容量毕竟有限,这种长期Memory具体怎么解决?
高宇翔:目前主要从两个方向做,这些方案也还在内部测试。
一个是先提升模型自己的理解能力。
模型如果真的理解当前任务,就会更清楚历史里哪些信息重要、哪些信息可以丢掉。所以Memory并不只是压缩问题,也和模型理解能力有关。
另一个是对长时序产生的大量KV Cache做压缩,既要保证实时性,也要控制显存消耗。
这方面大语言模型和视频生成已经有不少可以借鉴的技术路线,比如Linear Attention、Sparse Attention,还有基于Routing的关键信息筛选。
我觉得Long Context最后解决的并不是“能塞进去多少东西”,而是有限的模型容量下,能不能一直保留和调用真正有用的历史经验。
目前ICL还缺什么样的数据?
量子位:既然ICL能降低对海量数据的依赖,为什么数据仍然是一个问题?
高宇翔:ICL降低的主要是对“海量任务全覆盖数据”的依赖,但基础数据的数量和多样性依然很重要。
在UMI这类本体中心数据逐渐普及之前,行业很难获得以机器人自身动作、本体视角为核心的高质量数据。随着这类数据越来越多,模型才开始具备比较扎实的基础操作能力。
ICL并不意味着不再需要数据。
它更像是让机器人不必为每一个新任务都重新采集大量专项数据,但前提仍然是模型已经建立起足够好的基础能力。
量子位:那现在最缺的是哪一类数据?
高宇翔:现在比较明显的缺口,是人机教学、实时纠偏和协同作业这类数据。
如果希望机器人能够接受人的实时指导,做错之后被及时纠正,甚至和人一起完成任务,模型就需要见过大量类似的交互过程。
但目前行业对这类数据还没有形成成熟的定义和采集体系。
比如人类手把手教机器人时,哪些信息需要记录,纠错发生在哪个时间点,人的动作、语言和机器人的反馈应该怎么对齐,这些都还缺少统一标准。
所以我们后续也会重点去定义这类人机教学交互数据,包括应该采什么、怎么采,以及怎么把它用于ICL训练。

△图片由AI生成
“强理解,轻生成”
量子位:可可矩阵现在在ICL这一块,整体做到了什么阶段?
高宇翔:整体进度比我原本预期快一些。
量子位:你原本的预计是?
高宇翔:一开始我们判断,光是把模型的理解能力这一块打磨出来,可能就需要两三个月。但核心团队到齐之后,不到一个月,我们已经拿到了足以验证技术方案可行性的核心证据。
现在这部分技术路线基本已经跑通,下一阶段主要是在Scale数据,继续扩量、精炼数据,把模型能力往上推。
我们现在最核心的判断是“机器人后面的动作生成能不能做好,很大程度取决于前面到底有没有把物理世界理解清楚”。
量子位:在“理解”这一块,你们做了什么不一样的东西,可以具体聊聊吗?
高宇翔:我们现在做的是一套“条件表征”,或者可以理解成条件隐空间。
传统视觉表征通常是一帧图像对应一个固定Embedding。无论机器人现在