智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册

几亿美金砸出来的硅谷大模型,被一台相机干翻了!

数亿美金,竟输给了一台相机?

AITNT 3天前 27 AI技术

全球首个!银河通用新框架仅需人类视频即可部署,特斯拉蚌埠住了

终于,现学现用的风也是吹到了具身智能。

AITNT 3天前 23 AI技术

机器人需要「看到三维未来」!RynnWorld-4D重塑4D具身世界模型

近两年,视频生成模型在具身智能领域受到持续关注。从 UniPi、SuSIE 到各类 action-conditioned video generation 变体,其核心思路一致:先由模型生成一段未来视频,再从中提取动作信号供机器人执行。

AITNT 3天前 29 AI技术

让VLA更懂接触,优理奇UniTac让机器人拥有“触觉想象力”

机器人,也开始拥有“触觉想象力”了。

AITNT 3天前 33 AI技术

ECCV'26| 看起来会动,还要动得合理:从生成模型中主动寻找物理证据

PhyMAGIC通过让物体动起来,从视频中提取物理证据,帮助准确推断材料属性。它结合图生视频与视觉语言模型,生成针对性运动探针,并不断修正物理参数,最终构建出可微分的3D动态模型,实现更符合现实的视频生成。

AITNT 3天前 28 AI技术

让动态投机解码不再局限于DSpark:LightSpec首个开源动态MTP系统实现

随着 DeepSeek 发布 DSpark,动态 MTP(多 Token 预测)成为了对抗高并发、提升 GPU 利用率的绝对焦点。然而,DSpark 高度绑定特定模型且需要额外训练。

AITNT 3天前 14 AI技术

统计学20年悬案,GPT-5.6用90分钟破解!伯克利教授直呼「心塞」

困扰统计学界整整20年的核心悬案,被AI击碎了。

AITNT 4天前 17 AI技术

Lychee-FD:哈工大张民教授团队在全双工语音大模型领域取得重要突破,斩获ACL 2026杰出论文奖

全双工语音对话是人类最自然的交流方式,是语音对话研究的梦想。相比文本输入,语音天然更接近人的交流方式,但现有语音对话常常停留在 “一问一答、听完再说” 的轮次式交互范式。

AITNT 4天前 9 AI技术

分享一下我现在随时随地让Agent干活的远程操控方案。

昨天那篇文章,我说了一下我现在用Agent的日常。

AITNT 4天前 20 AI技术

全世界都在说超越了 PI,可他三个月没出新东西了。

大家好,我是瓦力,具身算法研究员。 我有个习惯,隔三差五都会去 PI 的官网刷一下,看他有没有新东西。最近这三个月,官网主页是一动没动,停在四月的 π0.7。

AITNT 4天前 20 AI技术

腾讯发布两大具身智能基座模型,VLM&RxBrain让机器人更懂现实世界

7 月 15 日,腾讯 Robotics X 实验室以及福田实验室联合腾讯混元推出两款具身智能基座模型 —— 具身 VLM 基座模型 Hy-Embodied-VLM-1.0 以及 具身世界认知基座模型 Hy-Embodied-RxBrain-1.0,不仅让具身大脑能够 “看” 懂现实世界,还学会同时推理和想象。

AITNT 4天前 22 AI技术

翁荔长文谈Harness自进化:Agent越用越强,评测难点怎么破?

近日,翁荔发布长文 《Harness Engineering for Self-Improvement》,系统梳理了 harness engineering 在 AI 自我改进中的作用。

AITNT 4天前 19 AI技术

刚刚,逐际动力放出一段Demo,Figure:睡不着啊

昨天刚完成2亿美元Pre-IPO轮融资,逐际动力没有急着讲资本故事,而是立马甩出一段全尺寸人形机器人Oli全自主做家务的视频:

AITNT 4天前 13 AI技术

为什么说以Xmax X2.0为代表的实时交互视频模型值得重视?

我们先来看两个画面。

AITNT 4天前 16 AI技术

几千人催我蒸馏的X冷启动Skill,开源了!

大家好,我是袋鼠帝 几天前我尝试做了一个相对粗糙的视频,是关于我开源的仓颉Skill的 没想到居然爆火了!(全网将近50万播放)。

AITNT 4天前 14 AI技术

大模型RL训练为何会「越训越窄」?ACL Outstanding Paper从token-level熵变揭示RLVR训练机制

基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards,RLVR)正在成为大模型后训练的关键技术。数学题能判对错,代码能跑测试,可验证奖励让大模型可以通过强化学习持续提升推理能力。

AITNT 4天前 11 AI技术

世界模型迎来「真考场」:WorldArena 2.0 Challenge正式启动

WorldArena 1.0 的核心意义,在于将世界模型评测从 “好不好看” 推进到 “是否真的有用”。它不再只关注视频观感,而是把物理一致性、可控性、3D 准确性和具身任务功能性纳入统一评测框架,使许多看似流畅的生成结果第一次在机器人具身任务中接受检验。

AITNT 4天前 18 AI技术

ISSTA 2026|LAVE:面向扩散语言模型的约束解码

推理大模型 (如 DeepSeek-R1、o1) 靠长思维链拿高分,却普遍「想太多」: 研究统计了五个代表性模型里,发现有 41–52% 的 token 是在模型给出它的最终答案之后生成的。

AITNT 4天前 12 AI技术

用推理步骤的「语义冗余」给LRM过度思考踩刹车

推理大模型 (如 DeepSeek-R1、o1) 靠长思维链拿高分,却普遍「想太多」: 研究统计了五个代表性模型里,发现有 41–52% 的 token 是在模型给出它的最终答案之后生成的。

AITNT 4天前 23 AI技术

Codex 桌宠保姆级教程:准备这 3 样东西就能开始

最近我在给 Codex 折腾一只自己的桌宠。

AITNT 5天前 19 AI技术