真机强化学习如何保证安全性?清华团队提出安全探索均衡机制
近日清华大学于IEEE TPAMI发表论文,探讨了真机强化学习的安全性保障问题,提出了一套「安全探索均衡」新型机制,揭示了安全探索的理论最大边界,并攻克了其收敛性证明难题。
TRM思考奖励模型上线,大模型推理质量终于能量化了 | ICML‘26 Oral
大模型推理能力越来越强,但答案对了,思考过程就一定好吗?
Codex兼容国产开源模型!实测DeepSeek接入:门槛还是太高
6月17日,X 上 OpenAI Codex 团队负责人 Tibo(@thsottiaux)发了一条推文,提醒大家 Codex App、CLI 和 SDK 现在可以接任何开源模型,不只限于 OpenAI 自己的模型。
LeCun、谢赛宁转发的世界模型与VLA共融方案:中关村学院ECCV2026—VLA-JEPA
依赖于有限机器人数据和大量人类数据,也能让 VLA 模型更稳健吗?
Seed 2.1 Pro 测评,终于能胜任 Agent 工作了
今天 Seed 2.1 Pro 正式发布,我提前用它做了一些测试。
实测豆包音频生成模型:语音模型的Seedance2.0时刻来了!
火山引擎今天上线了全新的语音模型—— 豆包音频生成模型 1.0(Seed-Audio 1.0)。
微信 AI 全网最细体验,我又爱上了刷朋友圈
微信 AI 终于来了。
中国团队拿下ICRA'26最佳论文:Agentic Coding驱动工业制造通往自主通用智能
刚刚,在维也纳落幕的机器人顶会ICRA 2026上,最佳论文奖(自动化方向)颁给了一支中国团队。
斯坦福改变了LLM的生成顺序,Google把它做了出来。DiffusionGemma技术报告来了
Google DeepMind在6月份对外分享了DiffusionGemma的技术报告,明确指向了一条与现有主流完全不同的演进道路。当大家都在绞尽脑汁让大模型逐词吐字的速度变快时,谷歌干脆把生成顺序改了。
又一大模型发布!号称比肩Fable 5和Mythos
<p><img alt="又一大模型发布!号称比肩Fable 5和Mythos" loading="lazy" src="/static/uploads/covers/58a7cf78b06c5eb7e920291138b11f80.webp"/></p><p><br/></p><p><strong>Sakana AI提出大模型训练新思路。</strong></p><p><br/></p><p>
如何使用 Codex,进行长程任务
这两天在赶工,鞭策 Codex 赶紧把 AGI Bar 的小程序弄出来,已经连续蹬了 80+ 小时了,预估再蹬 20 个小时就能蹬完
SCI 论文配图 Prompt 怎么写?这篇直接抄
做科研的人应该都懂,论文配图真的很耗时间。
530 万人读的这篇:你一直在用 AI 最慢的方式——附一段你今天就能粘的「自循环」提示词
这篇文章有 530 万浏览。我想先弄明白:为什么是它?
你的AI正在「见人下菜」,亚马逊团队ACL高分论文,首次系统测评「记忆」如何影响LLM情商
近年来,个性化语言模型迅速普及。 从 ChatGPT、Claude 到各类垂直 agent,用户 “长期记忆” 功能也逐渐成为标配,它们被广泛部署在推荐系统、客户服务、情感陪伴等场景中。
机器人终于不瞎抓了!港大阿里联手开源FineVLA:用哪只手、抓哪里,一句话全搞定
机器人模型已经能根据“把杯子放进篮子”这类指令完成任务,但用哪只手?
1W+优质提示词!这个网站塞满了神级AI出图Prompt,复制就能直接用
今天给大家分享一个我最近经常刷的灵感外挂。
从 OpenClaw 到 FastClaw:如何设计优秀的多 Agent 架构
做了一年 Agent 基础设施,踩了无数坑,我终于想明白了一件事:好的 Agent 架构不是把所有功能塞进一个进程,而是让每一层都能独立演化。
AI中转站正在「裸奔」:清华团队提出首个可信原生中转基础设施TrustedARI
当 AI 智能体真正开始干活,它的每一次请求,都要经过一个你看不见的「中间人」。
过程比结果重要:一个不给标准答案的调参框架,让Agent自己把数据库性能榨出来
数据库自动调参,一直是大模型Agent的“看似完美、实则翻车”名场面。
Sakana AI发布模型Fugu Ultra,号称比肩Claude Fable
就在所有人还在为Claude Fable 5的突然消失而懵圈时,Sakana AI却高调宣布:我们的Fugu比肩Fable,还不怕出口管制。