既要摸高,也要过河。
“如果只能选一个变量,今天最限制机器人从 Demo 走进真实世界的究竟是什么?”
9月9日,JDDiscovery-2026 京东全球科技探索者大会上,一场主题为“具身智能走出 Demo:真实世界数据如何成为产业基础设施”的产业圆桌,开场便围绕这个犀利的问题展开。嘉宾是已经完成从 Demo 到产业跨越的企业创始人和行业专家。

本场圆桌由 Koji 主持,五位嘉宾分别是:智元联合创始人、联席总裁、具身业务体系总裁姚卯青;智平方联合创始人张鹏;鹿明机器人创始人兼 CEO 喻超;逆矩阵科技创始人陈博远;京东探索研究院图像与多模态实验室主任黄浩洋。
他们分别代表了具身智能产业链的不同生态位,也是这一轮具身产业化的积极实践者。
本场讨论从一个最现实的问题开始:
机器人从 Demo 走向真实世界,到底还缺什么?
大家的答案逐渐指向同一个方向——真正的门槛已经不再只是单点模型能力,而是数据、反馈闭环和系统能力。
而 GPT-6 Astra 的出现,又把这个问题往前推了一步:具身模型本身的范式,会不会也要变了?
以下是本场对话的内容分享,经十字路口整理:
限制机器人走进真实世界的
是什么?
👦🏻 杨远骋 Koji
如果只能选一个变量,你们觉得今天最限制机器人走进真实世界的,究竟是什么?
🧑🎨 智元 姚卯青
变量的确很多。如果只选一个,我觉得最核心的是“智能化”本身。
机器人要能像人一样智能、灵活地去处理各种工作,而且要高效、高成功率,核心就是智能能力。

姚卯青|智元联合创始人、联席总裁、具身业务体系总裁
🤵🏻♂️ 智平方 张鹏
现在这个阶段,我们非常关注的一点是“真实的落地”。
从智平方的角度来说,我们关注的是,它到底能不能真实地产生生产力价值、到底能不能站得住脚。

张鹏|智平方联合创始人
🕵🏻♂️ 鹿明机器人 喻超
核心是,在真实场景里的任务闭环能力。
拆开来看有这几个层面:一是任务本身的闭环;二是闭环过程中的可靠性和泛化性,这里面涉及模型、智能、以及整个基建的层面;三是闭环过程中能不能持续地进行迭代。
现在已经不是某一个单点的问题,而是整体的系统级能力。

喻超|鹿明机器人创始人兼CEO
🧑🏻🚀 逆矩阵 陈博远
我更偏向于“反馈闭环”。
第一是模型侧本身的智能。
我们现在在一些受控场景里能做出非常好的 Demo,但真实场景是充满噪音和连续变化的。真实场景中,那些所谓的边缘情况其实不是长尾,而是常态。
所以,我们对通用智能的需求,是希望它能在家庭、工业场景等这些真实场景里,都能完成任意任务。这就需要模型要足够的智能,能进入到更深的场景。
第二也是更重要的一点是,要把真实场景里及时的数据,包括 corner case 数据反馈给模型,形成整个反馈的闭环。

陈博远|逆矩阵科技创始人
🧑🏻🏫 京东探索研究院 黄浩洋
京东图像与多模态实验室一直在做多模态基础模型,我们从大规模互联网语料里,学习视频生成和视频理解。
体现在具身这里,我觉得最缺的是“规模化的、可标注的、带动作标注的高质量真机数据”。
这是我们目前认为限制具身发展的最大因素,也是京东主推第一人称操作数据的原因。

黄浩洋|京东探索研究院图像与多模态实验室主任
关于落地、数据采集,来自一线的经验
👦🏻 杨远骋 Koji
谈到落地,鹿明机器人有不少产业落地的实践,最近有什么新的观察可以分享?
🕵🏻♂️ 鹿明机器人 喻超
我们在实践中看到,真实场景落地对整个系统能力的要求确实比较高。
它包括数据、data feedback,回流的数据怎么在模型里再次用起来,以及这部分数据怎么跟前面的数据做多源配比,等等。
另外,如果全部靠人工,节奏会非常慢,所以其实也需要一个类似“Codex for 具身”的系统。
现在,鹿明也正在构建自己的 NexCore 系统,作为实现任务闭环能力的载体。
👦🏻 杨远骋 Koji
能不能用一个具体案例展开讲讲,这套系统是怎么做到的?
🕵🏻♂️ 鹿明机器人 喻超
比如,我们早期做柔性质检、螺丝锁付。
最开始我们是在自己的工厂收集数据,然后做模型 training,再把机器人部署到真实产线,在这个过程中,我们会有多次数据迭代,根据实际运营情况调整回流数据,根据 failure case 去补充、调整。
随着机器人运转时间和工作时间的积累,整体的作业表现指标开始逐步往上走,我们现在也正在经历这个过程。

👦🏻 杨远骋 Koji
浩洋,从京东探索研究院图像与多模态实验室的角度,你们怎么看不同数据采集路径?
🧑🏻🏫 京东探索研究院 黄浩洋
各有特点。
第一种是真机遥操数据。它是最高质量的数据,能真实反馈行动和状态的改变,能对模型做实质性激发,但代价是非常昂贵、成本很高,很难规模化。
第二种是 UMI 数据,它能实现人类动作和机器动作之间的关联,成本相对较低。
第三种是仿真数据,这类数据的好处是,它能覆盖很多长尾情况,覆盖真实场景里很难触发的极端情况。
第四是我们最看重的 egocentric 数据,也就是第一人称视角的操作数据,它可以更快地规模化。
在我们看来,这四种数据构成了一个数据金字塔:
先用 egocentric 或仿真数据做模型预训练,让模型学会对空间和动作的理解;
然后用 UMI 数据,连接人类操作和机器操作之间的关联;
最后用 SFT 后训练,做精细化的真机操作。

黄浩洋|京东探索研究院图像与多模态实验室主任
👦🏻 杨远骋 Koji
京东最早做多模态模型用的是互联网数据,现在要和具身结合,有了更多真实场景的真机数据。都是训多模态模型,但在这两个阶段有什么相同和不同?
🧑🏻🏫 京东探索研究院 黄浩洋
一个是关注观测本身,一个是直接监督世界。
互联网数据能提供大规模图像、文本甚至视频的数据,可以让模型快速理解世界,它更多是做“理解世界的监督”——关注观测本身。
但具身数据不同,它更多是“作用于世界的监督”。比如,我执行一个动作,这个动作让世界的状态发生了什么变化——这是两者之间天然的 gap。
举个例子,一个人拿水杯。
对视频生成或理解模型来说,它从大规模语料中找出一个平均表征,生成一个人拿起水杯的视频,它只关注视频的合理性。
但对具身来说,我们要关注的是怎么拿起水杯、从哪个位置拿、用什么力度拿。
这就必须建立从行动到反馈的闭环。
这也是京东主推第一人称操作数据的原因。
今天上午,曹鹏总(京东集团技术委员会主席、京东云总裁)也讲到,我们计划未来两年推出 1000 万小时人体操作数据,同时推出超过 100 万小时真机操作数据。
这些数据都来自京东的零售、物流、家政、工业等真实场景,包含真实物体、真实人物,同时还覆盖大量操作中的失败案例。
事实上,仿真最大的问题是 sim-to-real 的难度很高,但通过真实采集,就能覆盖这些场景。
所以,从我们模型研发来看,我们不再只关注模型理解世界做得好不好,更重要的是“建立从理解世界到执行、到反馈、再到下一步执行的闭环”。
这也是我们现在从生成模型到世界模型、再到 World-Action Model 的转变。
从 Demo 到落地的几个关键点
👦🏻 杨远骋 Koji
在第一个问题中,姚总提到机器人从 Demo 走向真实落地的最大 gap 是“智能化”。从智元的角度,在“智能化”上最需要做的突破是什么?
🧑🎨 智元 姚卯青
从落地角度看,我认为有三个点比较重要。
第一是具备长程记忆,能基于过程做动态决策。
第二是灵巧和精度。人是一个非常精妙的构造,从自由度、全身协调到外部感知和触觉反馈,是一套非常精密的系统。机器人现在其实还在追赶状态,很多我们看起来简单的事情,对机器人来说非常难。
第三是纠错能力。现在机器经常能拟合一些状态和环境,但出现意外或失败时,很难完成闭环纠错。
行业里原来的思路是训一个越来越完备的端到端模型、world model,通过示教数据、RL 探索数据,大家希望靠一个模型完全解决掉。
但这个想法是比较理想化的。
最近大家在讨论:是不是应该通过分层架构,利用多模态大模型的能力,去完成上层对指令的理解、任务的拆分、状态的监督,以及对失败的重新规划、纠错,形成一套 agent harness 系统。
👦🏻 杨远骋 Koji
从智平方的角度,张鹏总你们怎么评估一项能力在 Demo 阶段做到怎样的程度,就可以进入规模化的部署阶段?重点看哪些信号?
🤵🏻♂️ 智平方 张鹏
Demo 和大规模商用之间,是一个探索的过程。从 Demo 走到规模化,有这两个前提:
第一,Demo 是展现技术能力,目标是验证技术框架和路线在场景下能 work,但真正产生商业价值,需要把客户、实际部署场景的各种变量,以及产品如何跟客户系统结合、跟商业模式结合起来,并且真正给客户创造价值。
第二,有了商业价值之后,还必须要有持续性、规模化的商业价值创造——也就是有规模化部署的需求。这里不光是看技术和模型能力,还要看闭环能力、硬件本体能不能支撑长时间稳定应用,以及售后、生产、质量体系能不能跟上。
最近几个月,在很多工业场景和新零售场景里,我们已经在很多场景下实现了长时间、稳定地工作。
这也是我们认为的可以做规模化商业部署的前提。

真实物理世界的基座模型
👦🏻 杨远骋 Koji
逆矩阵是今天在座最年轻的公司和创始人,过去这段时间,逆矩阵具体在做哪些事情?有什么新的成果?
🧑🏻🚀 逆矩阵 陈博远
用一句话总结,我们在构建一个真实物理世界的基座模型。
我们发现,真实物理世界在工业上是高度结构化的,但在家庭场景是非结构化的,同时泛化性要求很高。
这让我们想到语言模型的发展路径:2023、2024 年还有一些垂类的大语言模型,但到了 2026 年,一个通用语言模型就把这些垂类场景 one-for-all 解决了。原因是,通用基模可以利用不同 domain 之间可泛化和可迁移的知识和结构。
我们认为,物理世界也会走同样的路。
我们希望,构建这样一个理解人类物理直觉和本能的物理世界基座模型。
它能 all-for-one 地利用来自家政、零售、工业仿真等不同真实物理场景的数据以及仿真合成数据,帮助模型更好理解底层物理规律。
另外,我们最近也发现一些有趣现象,比如基模独有的 less is more 的效果。
同一个基座模型,只要微调少量数据左右,就能在灵巧手、轮式等不同机器人本体之间实现泛化和迁移。
👦🏻 杨远骋 Koji
构建一个理解人类的物理直觉和本能的世界模型,这其中最难的事情是什么?
🧑🏻🚀 逆矩阵 陈博远
主要分两点。
第一是范式本身。大家提到世界模型也好、VLA 也好,最核心的是我们怎么从真实