既要摸高,也要过河。


“如果只能选一个变量,今天最限制机器人从 Demo 走进真实世界的究竟是什么?”


9月9日,JDDiscovery-2026 京东全球科技探索者大会上,一场主题为“具身智能走出 Demo:真实世界数据如何成为产业基础设施”的产业圆桌,开场便围绕这个犀利的问题展开。嘉宾是已经完成从 Demo 到产业跨越的企业创始人和行业专家。


机器人走出 Demo,到底还差什么?我们和智元、智平方、鹿明、逆矩阵、京东聊了聊


本场圆桌由 Koji 主持,五位嘉宾分别是:智元联合创始人、联席总裁、具身业务体系总裁姚卯青;智平方联合创始人张鹏;鹿明机器人创始人兼 CEO 喻超;逆矩阵科技创始人陈博远;京东探索研究院图像与多模态实验室主任黄浩洋


他们分别代表了具身智能产业链的不同生态位,也是这一轮具身产业化的积极实践者。


本场讨论从一个最现实的问题开始:


机器人从 Demo 走向真实世界,到底还缺什么?


 大家的答案逐渐指向同一个方向——真正的门槛已经不再只是单点模型能力,而是数据、反馈闭环和系统能力。


而 GPT-6 Astra 的出现,又把这个问题往前推了一步:具身模型本身的范式,会不会也要变了?


以下是本场对话的内容分享,经十字路口整理:


限制机器人走进真实世界的


是什么?


👦🏻 杨远骋 Koji


如果只能选一个变量,你们觉得今天最限制机器人走进真实世界的,究竟是什么?


🧑‍🎨 智元 姚卯青


变量的确很多。如果只选一个,我觉得最核心的是“智能化”本身。


机器人要能像人一样智能、灵活地去处理各种工作,而且要高效、高成功率,核心就是智能能力。


机器人走出 Demo,到底还差什么?我们和智元、智平方、鹿明、逆矩阵、京东聊了聊


姚卯青|智元联合创始人、联席总裁、具身业务体系总裁


🤵🏻‍♂️ 智平方 张鹏


现在这个阶段,我们非常关注的一点是“真实的落地”。


从智平方的角度来说,我们关注的是,它到底能不能真实地产生生产力价值、到底能不能站得住脚。


机器人走出 Demo,到底还差什么?我们和智元、智平方、鹿明、逆矩阵、京东聊了聊


张鹏|智平方联合创始人


🕵🏻‍♂️ 鹿明机器人 喻超


核心是,在真实场景里的任务闭环能力。


拆开来看有这几个层面:一是任务本身的闭环;二是闭环过程中的可靠性和泛化性,这里面涉及模型、智能、以及整个基建的层面;三是闭环过程中能不能持续地进行迭代。


现在已经不是某一个单点的问题,而是整体的系统级能力。


机器人走出 Demo,到底还差什么?我们和智元、智平方、鹿明、逆矩阵、京东聊了聊


喻超|鹿明机器人创始人兼CEO


🧑🏻‍🚀 逆矩阵 陈博远


我更偏向于“反馈闭环”


第一是模型侧本身的智能。


我们现在在一些受控场景里能做出非常好的 Demo,但真实场景是充满噪音和连续变化的。真实场景中,那些所谓的边缘情况其实不是长尾,而是常态。


所以,我们对通用智能的需求,是希望它能在家庭、工业场景等这些真实场景里,都能完成任意任务。这就需要模型要足够的智能,能进入到更深的场景。


第二也是更重要的一点是,要把真实场景里及时的数据,包括 corner case 数据反馈给模型,形成整个反馈的闭环。


机器人走出 Demo,到底还差什么?我们和智元、智平方、鹿明、逆矩阵、京东聊了聊


陈博远|逆矩阵科技创始人


🧑🏻‍🏫 京东探索研究院 黄浩洋


京东图像与多模态实验室一直在做多模态基础模型,我们从大规模互联网语料里,学习视频生成和视频理解。


体现在具身这里,我觉得最缺的是“规模化的、可标注的、带动作标注的高质量真机数据”。


这是我们目前认为限制具身发展的最大因素,也是京东主推第一人称操作数据的原因。


机器人走出 Demo,到底还差什么?我们和智元、智平方、鹿明、逆矩阵、京东聊了聊


黄浩洋|京东探索研究院图像与多模态实验室主任


关于落地、数据采集,来自一线的经验


👦🏻 杨远骋 Koji


谈到落地,鹿明机器人有不少产业落地的实践,最近有什么新的观察可以分享?


🕵🏻‍♂️ 鹿明机器人 喻超


我们在实践中看到,真实场景落地对整个系统能力的要求确实比较高。


它包括数据、data feedback,回流的数据怎么在模型里再次用起来,以及这部分数据怎么跟前面的数据做多源配比,等等。


另外,如果全部靠人工,节奏会非常慢,所以其实也需要一个类似“Codex for 具身”的系统。


现在,鹿明也正在构建自己的 NexCore 系统,作为实现任务闭环能力的载体。


👦🏻 杨远骋 Koji


能不能用一个具体案例展开讲讲,这套系统是怎么做到的?


🕵🏻‍♂️ 鹿明机器人 喻超


比如,我们早期做柔性质检、螺丝锁付。


最开始我们是在自己的工厂收集数据,然后做模型 training,再把机器人部署到真实产线,在这个过程中,我们会有多次数据迭代,根据实际运营情况调整回流数据,根据 failure case 去补充、调整。


随着机器人运转时间和工作时间的积累,整体的作业表现指标开始逐步往上走,我们现在也正在经历这个过程。


机器人走出 Demo,到底还差什么?我们和智元、智平方、鹿明、逆矩阵、京东聊了聊


👦🏻 杨远骋 Koji


浩洋,从京东探索研究院图像与多模态实验室的角度,你们怎么看不同数据采集路径?


🧑🏻‍🏫 京东探索研究院 黄浩洋


各有特点。


第一种是真机遥操数据。它是最高质量的数据,能真实反馈行动和状态的改变,能对模型做实质性激发,但代价是非常昂贵、成本很高,很难规模化。


第二种是 UMI 数据,它能实现人类动作和机器动作之间的关联,成本相对较低。


第三种是仿真数据,这类数据的好处是,它能覆盖很多长尾情况,覆盖真实场景里很难触发的极端情况。


第四是我们最看重的 egocentric 数据,也就是第一人称视角的操作数据,它可以更快地规模化。


在我们看来,这四种数据构成了一个数据金字塔:


先用 egocentric 或仿真数据做模型预训练,让模型学会对空间和动作的理解;


然后用 UMI 数据,连接人类操作和机器操作之间的关联;


最后用 SFT 后训练,做精细化的真机操作。


机器人走出 Demo,到底还差什么?我们和智元、智平方、鹿明、逆矩阵、京东聊了聊


黄浩洋|京东探索研究院图像与多模态实验室主任


👦🏻 杨远骋 Koji


京东最早做多模态模型用的是互联网数据,现在要和具身结合,有了更多真实场景的真机数据。都是训多模态模型,但在这两个阶段有什么相同和不同?


🧑🏻‍🏫 京东探索研究院 黄浩洋


一个是关注观测本身,一个是直接监督世界。


互联网数据能提供大规模图像、文本甚至视频的数据,可以让模型快速理解世界,它更多是做“理解世界的监督”——关注观测本身。


但具身数据不同,它更多是“作用于世界的监督”。比如,我执行一个动作,这个动作让世界的状态发生了什么变化——这是两者之间天然的 gap。


举个例子,一个人拿水杯。


对视频生成或理解模型来说,它从大规模语料中找出一个平均表征,生成一个人拿起水杯的视频,它只关注视频的合理性。


但对具身来说,我们要关注的是怎么拿起水杯、从哪个位置拿、用什么力度拿。


这就必须建立从行动到反馈的闭环。


这也是京东主推第一人称操作数据的原因。


今天上午,曹鹏总(京东集团技术委员会主席、京东云总裁)也讲到,我们计划未来两年推出 1000 万小时人体操作数据,同时推出超过 100 万小时真机操作数据。


这些数据都来自京东的零售、物流、家政、工业等真实场景,包含真实物体、真实人物,同时还覆盖大量操作中的失败案例。


事实上,仿真最大的问题是 sim-to-real 的难度很高,但通过真实采集,就能覆盖这些场景。


所以,从我们模型研发来看,我们不再只关注模型理解世界做得好不好,更重要的是“建立从理解世界到执行、到反馈、再到下一步执行的闭环”。


这也是我们现在从生成模型到世界模型、再到 World-Action Model 的转变。


从 Demo 到落地的几个关键点


👦🏻 杨远骋 Koji


在第一个问题中,姚总提到机器人从 Demo 走向真实落地的最大 gap 是“智能化”。从智元的角度,在“智能化”上最需要做的突破是什么?


🧑‍🎨 智元 姚卯青


从落地角度看,我认为有三个点比较重要。


第一是具备长程记忆,能基于过程做动态决策。


第二是灵巧和精度。人是一个非常精妙的构造,从自由度、全身协调到外部感知和触觉反馈,是一套非常精密的系统。机器人现在其实还在追赶状态,很多我们看起来简单的事情,对机器人来说非常难。


第三是纠错能力。现在机器经常能拟合一些状态和环境,但出现意外或失败时,很难完成闭环纠错。


行业里原来的思路是训一个越来越完备的端到端模型、world model,通过示教数据、RL 探索数据,大家希望靠一个模型完全解决掉。


但这个想法是比较理想化的。


最近大家在讨论:是不是应该通过分层架构,利用多模态大模型的能力,去完成上层对指令的理解、任务的拆分、状态的监督,以及对失败的重新规划、纠错,形成一套 agent harness 系统。


👦🏻 杨远骋 Koji


从智平方的角度,张鹏总你们怎么评估一项能力在 Demo 阶段做到怎样的程度,就可以进入规模化的部署阶段?重点看哪些信号?


🤵🏻‍♂️ 智平方 张鹏


Demo 和大规模商用之间,是一个探索的过程。从 Demo 走到规模化,有这两个前提:


第一,Demo 是展现技术能力,目标是验证技术框架和路线在场景下能 work,但真正产生商业价值,需要把客户、实际部署场景的各种变量,以及产品如何跟客户系统结合、跟商业模式结合起来,并且真正给客户创造价值。


第二,有了商业价值之后,还必须要有持续性、规模化的商业价值创造——也就是有规模化部署的需求。这里不光是看技术和模型能力,还要看闭环能力、硬件本体能不能支撑长时间稳定应用,以及售后、生产、质量体系能不能跟上。


最近几个月,在很多工业场景和新零售场景里,我们已经在很多场景下实现了长时间、稳定地工作。


这也是我们认为的可以做规模化商业部署的前提。


机器人走出 Demo,到底还差什么?我们和智元、智平方、鹿明、逆矩阵、京东聊了聊


真实物理世界的基座模型


👦🏻 杨远骋 Koji


逆矩阵是今天在座最年轻的公司和创始人,过去这段时间,逆矩阵具体在做哪些事情?有什么新的成果?


🧑🏻‍🚀 逆矩阵 陈博远


用一句话总结,我们在构建一个真实物理世界的基座模型。


我们发现,真实物理世界在工业上是高度结构化的,但在家庭场景是非结构化的,同时泛化性要求很高。


这让我们想到语言模型的发展路径:2023、2024 年还有一些垂类的大语言模型,但到了 2026 年,一个通用语言模型就把这些垂类场景 one-for-all 解决了。原因是,通用基模可以利用不同 domain 之间可泛化和可迁移的知识和结构。


我们认为,物理世界也会走同样的路。


我们希望,构建这样一个理解人类物理直觉和本能的物理世界基座模型。


它能 all-for-one 地利用来自家政、零售、工业仿真等不同真实物理场景的数据以及仿真合成数据,帮助模型更好理解底层物理规律。


另外,我们最近也发现一些有趣现象,比如基模独有的 less is more 的效果。


同一个基座模型,只要微调少量数据左右,就能在灵巧手、轮式等不同机器人本体之间实现泛化和迁移。


👦🏻 杨远骋 Koji


构建一个理解人类的物理直觉和本能的世界模型,这其中最难的事情是什么?


🧑🏻‍🚀 逆矩阵 陈博远


主要分两点。


第一是范式本身。大家提到世界模型也好、VLA 也好,最核心的是我们怎么从真实