智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册

最适合机器人的视频基座模型,被中国团队开源了

蚂蚁灵波选择了后一条路:开源 LingBot-Video。这是一个面向具身智能的视频生成基座模型,也是一套专为机器人场景设计的 DiT 视频预训练范式。通用视频模型更多学习画面变化、镜头运动和视觉风格;LingBot-Video 则把重点放在动作、任务、交互和物理环境变化上,面向世界预测、动作理解和机器人训练构建视频生成基座。

AITNT 2026-07-10 200 AI技术

你的自教师模型还在用参考解吗?马普所联合清华大学推出d-OPSD,第一个针对扩散语言模型的在线自蒸馏学习

有没有一种更为合适的 OPSD 范式?近期,清华大学和马普所等机构的研究者们联合推出的 d-OPSD,给这一问题提供了完美的答案。这是第一个针对扩散大语言模型的 OPSD 范式,无需参考解,无需额外的教师模型,只需要 RL 十分之一的训练步数,便可以达到或超出 RL 的后训练效果。

AITNT 2026-07-10 198 AI技术

Zero-Shot、长记忆、抗干扰,DM0.5把VLA带进真实世界

今天原力灵机正式发布的 DM0.5 往前推进了一步。它不只是继续提高某些固定任务上的表现,而是围绕真实世界里的泛化问题做了一次系统突。 如果深入分析,就会发现 DM0.5 这几个核心提升,都是想解决一个问题:如何让具身模型从可控环境里的能力演示,走向开放环境里的稳定执行。

AITNT 2026-07-10 141 AI技术

不用人工标注,GUI Agent跑起「数据飞轮」:快手、浙大开源MobileForge

来自浙江大学 APRIL 实验室、快手主站技术部和清华大学的研究团队提出了 MobileForge,试图把手机 GUI Agent 的适配过程变成一个 “无标注、自探索、自反馈、自优化” 的闭环系统。

AITNT 2026-07-10 224 AI技术

ICML 2026 Spotlight | 直面「模态缺失」挑战:北大彭宇新团队联合福大柯逍团队提出LIMSSR,面向训练阶段不完整观测的精准评价

本文是北京大学彭宇新教授团队联合福州大学柯逍教授团队在细粒度多模态动作质量评价领域的最新研究成果,相关论文已被 ICML 2026 接收为 Spotlight,并已开源。真实世界中的多模态数据往往并不完整。在动作质量评价任务中,视频、光流、音频等模态能够从不同角度描述动作执行过程,但在实际采集时,传感器故障、环境噪声、隐私限制等因素都会导致模态缺失。

AITNT 2026-07-10 155 AI技术

多模态 Agent 记忆,为什么不能当成升级版多模态RAG?

多模态 Agent 的记忆系统,过去很容易被理解成一个升级版 RAG:图片、图表、PDF 进来之后,先抽取内容、做 embedding、写进向量库;用户提问时,再用 query 做检索,把命中的top-k图片、文档页或图表一并塞进上下文,再交给多模态模型回答。整个过程中,所有原始模态信息都会不加选择的塞给大模型。

AITNT 2026-07-10 149 AI技术

现代AI之父新作:13个大模型实测,检索agent真的可信吗?

近日,来自KAUST生成式AI卓越中心、吉林大学、浙江大学、瑞士人工智能实验室等机构,由包括「现代人工智能之父」Jürgen Schmidhuber在内的研究者组成的团队,发布了一篇回答这个问题的研究论文。

AITNT 2026-07-09 155 AI技术

蒸馏效果起飞!DOPD破解「特权幻觉」,让在线策略蒸馏更有效

最近,来自新加坡国立大学、香港中文大学 MMLab、北京大学和京东探索研究院的研究团队提出了一种全新的在线策略蒸馏方法: DOPD (Dual On-policy Distillation) ,通过优势感知的双重蒸馏范式,成功破解了这一难题。

AITNT 2026-07-09 185 AI技术

机器人为什么要拟人?终于有人正确回答了

6 月 30 日,深度机智团队发布论文 Human-as-Humanoid。他们在自研拟人机器人 PrimeU 上,实现了完全没有目标任务真机示范数据的情况下,仅凭从人类视频中转换而来的动作监督,零样本完成了倒水、放环、装袋、叠杯等复杂真实操作任务。

AITNT 2026-07-09 160 AI技术

DeepSeek之后,中国AI「自己出题」杀进Nature通讯!全球仅4家

2026年5月28日,Nature通讯发表了题为 《Multimodal deep learning model for AI-based functional prognostic risk stratification in patients undergoing radical nephrectomy》 的论文。

AITNT 2026-07-08 135 AI技术

3.8万小时、狂烧天价token:字节发现Agent的 Scaling Law

7月2日,字节 Seed 发布了一个 Agent评测项目 EdgeBench。看起来又是一个 benchmark,但它问了一个其他榜单不问的问题。EdgeBench 的切口就是把盲区里的东西放进评测,解答一个问题:把Agent扔进一个陌生环境,12小时后,你能变强多少?

AITNT 2026-07-08 153 AI技术

竞赛编程Agent进入全球前十!南大、清华新模型CF rating超3500

大语言模型在代码生成上的能力不断增强,但在复杂算法题,尤其是竞赛编程场景中,仍然容易因为算法选择错误、边界条件遗漏、复杂度判断失误或隐藏测试覆盖不足而失败。Solvita是一款面向竞赛编程的智能体框架,通过四个角色(Planner、Solver、Oracle、Hacker)形成闭环系统,并利用可训练的图结构知识网络积累经验。

AITNT 2026-07-08 303 AI技术

提示词压缩竟成大模型新漏洞?港科大提出黑盒攻击框架COMA | ASE 2026

现在的 AI Agent 动辄需要处理超长上下文,既要看系统提示词、工具说明,又要翻阅历史对话和检索文档。为了省钱、省算力并降低延迟,很多开发者会给系统加上 “提示词压缩”(Prompt Compression)模块,把冗长的上下文浓缩后再喂给大模型。

AITNT 2026-07-08 119 AI技术

中国科学院携手全球顶尖机构发布首个十亿参数级的手术视频基础模型SurgMotion!

手术 AI 正在从 “单帧感知” 迈向 “全流程视频理解” 的全新时代!近日,由中国科学院香港创新研究院人工智能与机器人创新中心领衔,发布了全球首个十亿级参数、最大规模数据集练成的手术视频原生基础模型 ——SurgMotion!

AITNT 2026-07-08 169 AI技术

AI生图免训练提速1000%,办法:最简洁的“三阶段流水线”

MrFlow(Multi-Resolution Flow Matching)就用这样的三阶段,在Qwen-Image等模型上把端到端生成时间从49.32s压到4.77s,实际加速10.35x。文章发布当日即登上Hugging Face Daily Papers;发布三天内,GitHub已收获200+stars;目前也已登上Hugging Face Trending Papers。

AITNT 2026-07-08 227 AI技术

解读 | 2026全球AI经济全景研报:千亿营收、万亿开支,繁荣背后的三重核心矛盾(附原版PDF)

Exponential View 在 2026 年 6 月底发布《AI 经济现状报告》,通过一套去重复统计、自下而上覆盖千余家企业的财务测算模型,剥离行业虚高估值与宣传泡沫,还原海外生成式 AI 市场真实营收、资本开支、算力供需与产业链价值分配格局。

AITNT 2026-07-08 199 AI技术

具身智能空间视觉死穴,终于被最新顶会彻底解决!

VLA 大模型看似强大,却被一个致命弱点扼住喉咙——相机稍微挪动几毫米,操作成功率就能暴跌一半。招商局先进技术研究院下属实验室提出新的移动数据范式,首次在真实机器人系统上证明:让相机动起来采集数据,就能以极低成本破解 VLA 的空间泛化瓶颈,且效果普适于多种主流架构。被一个致命弱点扼住喉咙——相机稍微挪动几毫米,操作成功率就能暴跌一半。

AITNT 2026-07-08 146 AI技术

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

针对这一问题,openJiuwen社区正式发布Skill-Omni——业界最早工程化落地的多模态Skill范式。 它让Agent的经验从“读得懂”升级为“看得见”,把网页和视频中的视觉知识,沉淀为Agent可复用的多模态Skill。

AITNT 2026-07-08 135 AI技术

刚刚,翁荔博客又上新:通过Harness工程实现AI自我提升

刚刚,翁荔(Lilian Weng)又更新博客了!距离她上一次更新《谨慎对待 Scaling Law》还不到 10 天。这一次,她书写的主题是当前大热的 Harness Engineering,聚焦的正是当下 AI 研究最前沿一个环节:当模型本身的智能已经足够强大时,真正决定它能走多远的,或许是包裹在模型外面的那层「Harness」也就是负责编排模型思考、调用工具、管理上下文、评估结果的那套系统。

AITNT 2026-07-07 160 AI技术

刚刚,DeepSeek 文档更新,Agent 开发者要注意这个字段

刚刚,DeepSeek 在官方 API 文档里给出了一个 thinking mode 和 tool call 结合使用的样例。表面上看,这只是一个常规的工具调用演示:用户提出问题,模型判断需要调用工具,工具返回结果后,模型再继续生成答案。

AITNT 2026-07-07 145 AI技术