走进一家大型汽车制造商的线束车间,你会看到和整车工厂截然不同的画面。


整车车间干净、明亮、几乎完全自动化。线束车间密密麻麻,弥漫着汗味。


很多工人培训一个月,在岗坚持不到三个月就离开了。


这是工业自动化界公认的「深水区」。


WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放

图为AI生成


如今,被具身智能彻底打爆了。


2026年WAIC,它石智航把一条1:1还原的环形线束流水线,搬进了展馆。多台机器人集群合作,流水线轮转线束板,每个工位同一时间装配不同的线束线型。


WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放


效率自然大幅提升。它石智航首席科学家丁文超甚至调侃道:


现场我们都不敢让它一直干活,怕机器人干太快给料用完了。


撑起这条全自动化产线的,是它石智航刚刚发布的具身原生基座模型AWE 3.5


这也是具身智能领域第一个真正打通预训练到后训练完整范式的原生模型。


一台机器人的「多任务实战」


它石给新版本取名3.5,信号也挺明确的:希望它像GPT-3.5一样,在多任务能力上开始展现新的可能。


回看AWE的发展趋势,也确实是这样。


3.0首秀,它石打爆了线束场景。


WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放


到了3.5,模型开始向更多场景溢出。工业装配、插接、收纳……全部被放进同一个模型里。


今年它石WAIC展台的主题-打造可信赖的物理AI,也是围绕这项特点展开,任务之间不重新加载新的模型,不切换参数,全靠同一个基础模型。


现场的展示非常魔幻,他们的机器人简直是「劳模」,整理桌面、打包手机、插网线、零件分拣……反正不管啥东西,递过去就开干。


用丁文超的话说就是:


跟主播带货一样(笑)。


WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放


但,这只是开胃菜。


2026年是世界模型百家争鸣的元年,不过,究竟什么是世界模型?


在大部分人的认知里,它还是论文里的架构图和评测表格里的数字。


这次,它石智航在WAIC给出了最直接的答案:


你上手试一试。


现场观众戴上数据采集夹爪,就能和一个由AWE 3.5生成的平行世界展开互动。


你捏起一块积木,松手,积木像受重力一样落向桌面。你拖拽手机盒,盒子产生对应的位移和摩擦。蜡烛上微弱的火焰,也在模型中被忠实地呈现出来。


WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放


这些交互没有一行牛顿定律代码,没有碰撞引擎,没有物理结算。所有重力、柔性、碰撞反馈、物体位移……全部,由模型从真实类数据中学到。


而在这个涌现之外,有一项被严重低估的能力:长时记忆与空间理解。


视频模型有一个难以治愈的缺陷——


预测未来的时间一长,物体就容易突然消失、变形,或者在一帧幻觉之后彻底蒸发。


究其根本,像素监督本身不鼓励长程物理交互的连续性,无法用于具身训练。


为此,AWE 3.5依托human-centric数据专门强化了模型结构,让它显式学习长时记忆和长时序空间理解,在数分钟的连续、交互闭环推演中保持环境稳定。在此基础上,后训练可以从连续过程中切出多个动作片段,而不用担心环境在下一秒崩掉。


在世界模型中做强化学习,成为了可能。


原生模型,从第一性原理重构具身大脑


今年以来,行业一直有VLA or 世界模型的争议,但最近和很多做具身的朋友聊了后发现,真正训模型的人根本不在乎所谓路线之争。


无论哪条路线,最终,还是要看是否能优化Action。


VLA架构里,视觉和语言在预训练阶段就紧密耦合,动作模态却要到后训练才通过SFT接入。这相当于一个学生先学了全部理论课,临考试前才开始动手做实验。理论和实操之间,隔着一道先天的裂缝。


世界模型路线往前走了一步,至少可以利用大规模视频学习表征能力。但互联网视频模型的Attention结构已经在几十万到百万小时的猫狗视频上定型了,直接往具身基座模型里嵌,容易走向两个极端:


1、视频模型原有的幻觉跑进动作策略,导致操作不到位或判断混乱;


2、视觉理解、空间理解和动作永远无法同步。


因此,早在行业掀起「世界模型」热浪前,它石从第一天便毅然选择了另起炉灶——


从头训一个原生的具身模型。


具体而言,AWE 3.5从预训练阶段开始,就把视觉、语言、动作等多种模态一起喂给模型。同一套架构,既能输出动作,也能预测未来。


丁文超把它称为One Model结构。


这个架构设计有一个精妙之处:模型本身不变,只改变输入输出的组合方式,就能切换出完全不同的「人格」。


视觉到动作,是Base Policy,负责制定策略、发出指令;以动作为条件预测未来视觉,是Action Condition World Model,负责预测环境变化。两者交互在一起,就是一套完整的强化学习闭环。


打个比方:打包书包时拉拉链。


这是一个毫米级精度的活,而且处处是「卡点」。拉多一点可能成功,拉少一点可能抓不住,用力过猛可能卡住。


传统的做法是把机器人放在真机上一遍遍试,失败一次就记录一次,数据贵、速度慢、设备磨损还大。


WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放


AWE 3.5的做法是:先在预训练模型的「脑海」里模拟。模型想象拉链在不同力度下的各种结果,然后把最优策略告诉Base Policy。这比在真机上反复试错快了不止一个数量级。


这就是它石原生模型最核心的突破:模型成了自己的「仿真器」,而无需手工搭建仿真环境。预训练建立通用物理交互能力,后训练在模型内部的世界里自我对弈、自我强化,形成自闭环。


这套范式,是语言模型在文本领域已经验证过的路径;但在具身原生模型里,它石开发的AWE 3.5是第一家完整跑通的。


而之所以能成,也是它石长期布局之下两条暗线的交汇所赐——


足够大的真实数据规模,以及能消化大规模数据的Infra。


缺任何一样,这个闭环就转不起来。


先看数据量——


AWE 3.5,基于超百万小时human-centric数据训练。


这个量级有多夸张?


这么说吧,目前市面上大多数视频生成模型,训练数据是在百万小时级别。


自动驾驶所需数据,也是这个量级。


但百万小时,不是简单的堆量游戏。


具身数据的价值分布极不均匀。部分数据对模型至关重要,但重复度高、交互单一的数据,对模型几乎没用。


如何从百万小时中筛出真正高质量的部分,已经成为比采集本身更紧迫的问题。


这对数据Infra提出了极高的要求,也是它石这几个月以来重点优化的方向。


它石数据系统的重心,正在从「更多」转向「更聪明、质量更高」,Data Efficiency正在成为新的评测维度。


WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放


而当数据规模和数据效率同步上去后,Scaling的威力也终于得到了印证。


丁文超表示,现在预训练已经足够扎实,一个新任务只需要小时级别的数据采集就能跑通。


这正是当初它石选择One Model架构的前瞻性:先建立通用基础能力,再向各个场景分发。


如今随着AWE 3.5发布,这项前置战略的红利也终于开始显现——


它石等的,从来不是线束这一个场景的闭环。


量子位获悉,除线束之外,柔性操作、分拣、检测协同……等多个工业场景,也已经在验证中。


WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放


基于此,丁文超给出了一个大胆判断:


具身Scaling已全面释放。2027年上半年到年中,可能出现分水岭。


行业已经从「机器人文娱舞蹈」,进入「机器人真干活」的阶段。


展会热度,则是一个先行指标。今年的WAIC,具身智能企业超过200家,机器人展区的人流明显超过其他区域。


而它石的展区,同样也是堆满了人。


WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放


「机器人究竟什么时候进厂干活?」——这个问题,无论线下还是线上,都已经很少再被人提起。


原因很简单:各大头部厂商早已争相把机器人送进了工厂的深水区,让它在真实环境中摔打、学习、迭代。


WAIC世博展馆一楼,从北门进入,映入眼帘的便是「模登时代·伙伴之城」。一个机器人各司其职、埋头干活的实景展区。


而进门右侧第一个展位,它石带来的汽车精密线束装配演示,无疑是其中最为独特的一个。


我亲手体验了一番:插孔极小,必须眯起眼睛才能勉强对准,即便插了进去,也很可能是误插,必须要插到正确点位才能使用。人工操作尚且如此,对机器人而言,难度可想而知。


WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放


这是它石首次亮相WAIC,也是我第一次在线下近距离观看他们的Demo。但说实话,这或许就是WAIC这类线下活动的意义吧,看完之后,脑海中原本模糊的印象一下子变得具象起来——


这不仅是一家技术过硬的公司,更是一家特点鲜明、场景定位极其清晰的具身智能企业。


这也是丁文超在与量子位对话中,反复强调的观点:


具身智能的下一步,是让系统获得梯度,也就是明确的迭代方向。而这个方向,不可能仅靠公司内部的几个Demo来牵引,它必须来自真实场景的正反馈。


它石正在做这件事。


WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放


对话它石首席科学家丁文超


具身Scaling能力释放


量子位:从AWE 3.0到3.5,研发过程中有哪些困难超出了最初预期?


丁文超:整体框架基本符合之前设定的节奏,但有两点与最初的判断存在偏差。


第一点是硬件与软件协同设计(Co-Design)的重要性远超预期。我们在AWE 3.0阶段已经意识到这个问题,到了3.5及后续版本,灵巧手的关键作用愈发凸显。


夹爪能解决大约80%的问题,但剩下20%如果全部依赖特制夹爪,工程难度极高。当前灵巧手正在走向成熟——它能否真正胜任实际任务并跑通商业闭环,很可能成为具身智能领域的一个重要里程碑。


做好灵巧手,需要数据、模型和硬件三者兼备,因此它也是检验一家具身智能公司综合实力的「黄金测试」。我们在实践中逐步加深了对手的重要性的认知。


WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放


从AWE 3.0之前开始,我们就持续投入自研灵巧手。市面上很多产品采用Bottom-Up的思路——先追求高自由度,再从硬件出发。我们的路径更接近Top-Down:先梳理需要完成哪些人类动作、匹配哪些人类数据,再反向定义硬件设计。这是一项计划之外、但在过程中不断加大的投入。


第二点是具身智能的Scaling已经解锁。如果行业继续朝这个方向聚集资源,头部效应会更加显现。


量子位:它石的human-centric数据已经达到百万小时,能否讲讲它石具身数据的Scaling曲线长什么样?


超:我们在具身领域对Scaling的定义是:通过合理的预训练与后训练范式,将完成新任务所需的数据量和采集成本降到最低。


目前,一个新任务普遍只需要小时级别的数据采集,就能让模型将任务完成到大致可用的程度。这条边界,我们已经触碰到了。


量子位:要实现物理AGI,数据还需要增长到什么规模?


丁文超:这会逐渐演变为一个长尾问题。当基础数据积累到一定规模后,能够贡献高价值增量的新场景会越来越少。


到了那个阶段,与其纠结数据总量,不如回到一个更本质的问题:模型到底要完成什么任务?我们要采什么样的数据?如何以可控的成本让机器人胜任尽可能多样的任务?


两者有交集,但在实际推进路径上存在明显差异。


量子位:落地闭环会反过来影响模型训练?


丁文超:基础数据达到一定规模后,当然可以继续堆量。但真正的难点在于让系统获得「梯度」——也就是明确的迭代方向。这个方向不可能靠公司内部几个Demo来持续牵引,它必须来自大量真实场景需求的正反馈。


所有成功的AI都受到真实需求的驱动。语言模型早期有非常多的应用方向,但真正把模型能力推向极致的应用之一是AI Coding。虽然AI Coding是一个垂直应用,但它倒逼模型公司建立起预训练、大规模数据闭环、Harness Engineering等一整套体系化能力,因此提供了极强的正反馈。


其他应用同样存在,只是规模相对更小。正是这些应用的牵引,让行业对语言模型能否走向AGI有了更坚定的判断。闭环跑通之后,技术的先进性才有了清晰的衡量标准。


具身智能同样需要找到若干个类似AI Coding级别的应用。它的能力不会局限于这些场景,但正反馈通路能让数据、模型和Infra形成一条稳定、可靠、可扩展的完整链路。