Naive AI 正在探索一条令人兴奋的新路径:让当前的 AI 模型去承担下一代模型的研发工作,并且让每一代诞生的模型都能够比上一代承担更多的研发工作。


10 天前,Anthropic 公布了一组少见的内部数据:公司内部的 AI 研发工作中,已有 26% 由 Claude「主导」完成。所谓主导,是指研究员只需给出一条高层指令,Claude 就能端到端地完成任务的大部分,人类负责监督。而在今年 2 月,这个比例还不到 1%。


而这并不是一个孤立事件。更早几天,OpenAI 宣布去年定下的「自动化研究实习生」目标已经达成:按标准工作日折算,其研究团队每投入 1 个人类工作日,就有约 3.1 个智能体工作日在同时运转。


9 月 21 日,OpenAI 又提议由美国牵头制定前沿 AI 全球技术标准,并把递归式自我改进(RSI)列为重点议题。


国内,智谱也在 9 月 17 日披露,由 GLM-5.3 驱动的 Infra Agent 在十万卡国产集群上,从零搭起了 GLM-5.3-Flash 的推理服务。


OpenAI 博客中对 RSI 的定义


短短半个多月,「让 AI 研发 AI」就已经从一个偏理论的话题变成了头部实验室争相公开的量化指标。


但仔细看,这些数字回答的大多是同一个问题:研发下一代大模型,AI能接手多少工作?


而就在今年 2 月,当 Anthropic 的 AI「主导」比例还接近零的时候,代季峰的创业团队Naive AI成立了。


这家新创公司从一开始就摒弃了传统以人类为中心的研发体系,把写代码、跑实验、监控流程、分析结果等研发工作交给了 AI 模型。而人类研究员把精力集中于三件事:提出目标,设定约束与评价标准、最终决策。


从第一天起让 AI 研发 AI,


这家新公司交出了首款模型


路线选择上,Naive AI 专注于开源模型后训练与 Agent 研发,没有从零预训练,而是以开源模型为起点,做架构改造、增量预训练和后训练。


开源生态正在成为新一批实验室的起点。前 OpenAI 首席技术官 Mira Murati 创办的 Thinking Machines Lab,7 月推出的首款模型 Inkling 虽是从零训练,架构却沿用了 DeepSeek-V3 的混合专家设计。


Naive AI 更进一步,直接基于开源基模继续训练和改造。开源基模已经足够强,新实验室的竞争点,正从「能不能从头训出一个基模」,转向「能不能更快、更好地把基模改造成自己要的样子」。


Naive AI 押注的,正是后者背后的研发效率。


其刚刚发布的首款模型Naive-N0.5-Flash,总参数量为 309B,激活参数量为 15.5B,原生支持百万 token 上下文,面向编程与 AI 研发。


用AI造的!刚刚,代季峰团队首个模型开源


它有一个双重身份:由 AI 参与研发,也被专门训练来承担AI研发工作。


技术报告显示,AI 已经参与了注意力架构的探索,以及训练、推理和部署系统的优化。研究员设定目标、约束与评价标准,AI 据此实现候选方案、运行实验,并根据结果继续调整;涉及架构选择等关键决策,仍由研究员把关。


官方的两个配套案例,让这套研发方式有了具体的呈现:


  • 在推理运行时 NaiveRT 的优化中,研究员与 AI 用六天推进了 151 轮实验,将同一系统的一轮完整投机解码耗时从 12.3 毫秒降至 3.4 毫秒。
  • 另一项任务中,Naive-N0.5-Flash 接下世界模型研究工作,经过累计 400 小时、 15 轮主要实验,持续调整数据、训练方案与推理策略,最终得到 AutoWM,其已跻身 WorldArena 第一梯队。


此外,Naive AI 实习生、清华博士生 Shiqian Su 也在 𝕏 上分享了一个使用 Naive-N0.5-Flash 训练 Jev 模型的示例,所得到的多模态类 Jev 模型在俄罗斯方块与贪吃蛇这两个小游戏上的表现非常亮眼,均优于 Jev 以及开源的 Laya。


视频详情


让Naive N0.5承担训练工作,训练出来的多模态模型负责玩俄罗斯方块和贪吃蛇。环境与数据准备、模型和训练方法选择、测试构建,以及后续的训练、评估、纠错和迭代,都由Agent自行推进。这个过程中,Agent还会根据获得的证据调整方案。


这些案例背后,Naive AI  正在尝试把模型投入后续研发,让它参与解决下一轮迭代中的实际问题。而这条路线的起点仍是模型本身的能力:它能否读懂论文、实现方法,并在一连串实验之后,找到值得继续推进的方向?


围绕这些问题,Naive AI 的首份技术报告给出了从模型设计、训练到研发任务评测的一套结果,也让外界得以具体观察,这个创业团队准备怎样进入大模型竞争。


摒弃传统,走向 AI 原生的研发方式


把一篇机器学习论文交给模型,距离得到可以检验的复现结果,中间还有很长一段路。模型需要理解方法、完成实现、组织实验,还要处理运行过程中不断出现的问题。


围绕这些研发任务,Naive-N0.5-Flash 交出了一组非常亮眼的核心评测结果。


先看考察论文复现能力的 PaperBench。Naive-N0.5-Flash 取得了 63.2 分,高于报告中的 Claude Opus 4.7、GPT-5.5和 MiniMax M3。


对于一款面向 AI 研发的模型,这项成绩提供了一个直接的观察窗口:面对论文中的研究方法,它能将多少内容落实为具体实现。


机器学习工程提供了另一种考验。在源自 Kaggle 竞赛任务的MLE-bench-30上,Naive-N0.5-Flash 取得了73.7%的成绩,任务涉及围绕数据开展模型训练与实验。


进一步聚焦模型研发,在要求固定计算预算下进行语言模型后训练的 PostTrainBench上,它取得了 37.5 分。


用AI造的!刚刚,代季峰团队首个模型开源


Naive-N0.5-Flash 的 AI 研发相关评测与优化结果,涵盖模型后训练、机器学习工程、论文复现、训练和 GPU 算子优化。


这几类评测覆盖了研发中的不同环节。论文复现关注对已有研究的理解与实现,机器学习工程考察解决具体任务的能力,后训练任务则要求模型在资源约束下寻找改进方案。它们共同提供了判断模型能否参与研发的依据。


上图中还有一组对照值得留意。在 Sol-ExecBench(GPU 算子优化)、NanoChat AutoResearch(固定预算下的训练改进)和 NanoGPT SpeedRun(训练提速)三项任务上,比较对象是 Recursive Superintelligence。这家由 Richard Socher担任 CEO、田渊栋参与联合创办的公司,专做自动化 AI 研究。


该公司在 6 月公布了首批结果:社区优化了两年多、累计 83 次人类刷新纪录的 NanoGPT Speedrun,被它的系统从 79.7 秒压到了 77.5 秒——而现在Naive-N0.5-Flash将这个成绩提到了 73.8秒。


编程能力是完成这些工作的基础。在要求根据自然语言需求生成代码仓库的 NL2Repo 上,Naive-N0.5-Flash 得分为71.9,高于 DeepSeek-V4.1-Flash。


在面向长程专业任务的 ALE-CLI上,它取得 32.4 分,接近 GPT-6 Astra与 Opus 5.5。


用AI造的!刚刚,代季峰团队首个模型开源


Naive-N0.5-Flash 的编程与长程任务评测结果,涵盖软件工程、代码仓库生成、终端操作等任务。


看起来,Naive-N0.5-Flash 在论文复现、机器学习工程和长程任务中,展现出了相当强的竞争力。


研发任务还有一个实际特点:工作推进得越久,需要处理的历史信息往往越多。一次训练报错,可能需要结合此前的代码修改来定位;决定下一轮实验方向时,又需要回看已有结果及其对应配置。


而原生 1M 上下文为保留这些任务历史提供了空间。代码、工具返回与实验记录能够被纳入更长的交互过程,为模型关联分散信息、持续推进任务提供支撑。


按照报告披露的开放方案,Naive-N0.5-Flash 的模型权重与推理代码采用 MIT 许可,将提供 API。输入、输出与缓存读取的价格,分别为每百万 token 0.6 、2.6 和 0.07 人民币,研究者和开发者可以据此选择部署与接入方式。


长上下文也会带来具体的计算负担。要让模型在持续交互中保持可用的运行效率,注意力计算、跨卡通信和显存管理都需要跟上。Naive AI 对模型架构与训练系统的改造,正是围绕这些问题展开。


接下来,我们进一步看看首款新模型的诞生过程,AI 同样承担了不少具体工作。


研发 N0.5,AI 参与到了哪一步?


研发 Naive-N0.5-Flash ,首先要解决百万 token 上下文带来的效率问题。团队以开放权重的 MiMo-V2.5 base 为起点:这个基模的大多数层采用滑动窗口注意力(SWA),关注局部信息,少数全局注意力层负责保留长程信息。上下文增长到百万 token 级别后,这几层全局注意力会贡献相当一部分解码开销。


Naive AI 将改造目标放在了这些层上,用 DeepSeek 稀疏注意力(DSA)替换全局注意力。DSA 先通过轻量索引器对历史位置打分,再选出其中的 2048 个位置,交给主干网络计算注意力;SWA 则处理 128 token 的局部窗口。整个网络以五层 SWA 搭配一层 DSA 的布局为主,构成一套混合稀疏注意力架构。


用AI造的!刚刚,代季峰团队首个模型开源


SWA—DSA 混合注意力架构


团队还采用了四个 KV 分组的 GQA,并设计了具有 16 个 query 头的轻量索引器,进一步调整索引与注意力计算的开销。需要说明的是,DSA 的索引器仍需扫描完整历史,相关层也仍需保留完整 KV 缓存,这套改造主要减少了主干注意力的计算量与访存量。


用AI造的!刚刚,代季峰团队首个模型开源


把索引器的查询头从64个减到16个,可以显著降低长上下文稀疏注意力的处理耗时。


这套方案由研究员与 AI 共同探索得到。研究员设定目标与评测协议,要求在提升长上下文解码效率的同时保持模型质量;AI 负责实现候选架构、运行消融实验并汇总结果。在满足目标的方案中,研究员最终选择了工程实现较为简洁的一种。


改完注意力结构,模型还需要重新适应信息的读取方式。 为此,Naive-N0.5-Flash 在 1M 上下文配置下完成了累计 3.25T token 的多阶段训练:


  • 首先,最初的 50B token 用于索引器预热:冻结模型其余参数,让准备切换为 DSA 的层继续使用全局注意力,再以其注意力分布为监督信号,通过 KL 散度损失训练索引器。
  • 随后,模型切换到稀疏注意力,进行 3T token 的继续预训练,以语言建模损失为目标,适应新的信息选择与聚合机制,并强化编程和 AI 研发能力。
  • 最后,再用200B token进行监督微调(SFT),并逐步降低学习率。


这次切换中,AI 承担了一项验证工作:以全局注意力结果为参照,分析索引器选出的 top-2048 位置的召回情况。报告称,AI 在这个过程中发现并修复了 top-k 选择的数值稳定性问题,又独立验证了修复结果。研究员据此确定切换时机与精度阈值,并统一训练和部署阶段的验证标准。


更深一层的工作发生在训练系统中。百万 token 的序列需要被分配到多张 GPU 上处理,如何交换各卡上的信息,会直接影响训练效率。


AI 在分析混合架构时,抓住了两类注意力的访问差异:DSA 需要完整历史,SWA 关注左侧的局部窗口。基于这一点,它提出并验证了混合序列并行方案:DSA 层使用 Ulysses 序列并行,通过 all-to-all 重分配访问完整序列;SWA 层采用重叠分片,与左侧相邻分片交换必要的重叠区域。


这样,SWA 部分的通信复杂度就从随序列长度增长的 O(L),降到了与窗口大小相关的 O(w)。这一思路也被延伸到推理侧,让长上下文预填充、按行分片计算和索引检索分别采用相应的上下文并行方案。


显存管理同样需要细化。针对稀疏索引与注意力对齐产生的中间激活,AI 分析重计算路径,将卸载粒度细化到单个算子的输出,让不同中间结果可以分别配置卸载策略;top-k 索引则显式保留,在重计算时继续使用已选位置。长序列下的检查还发现了位置编码精度问题和序列索引越界风险。


按照披露的数据,这套训练系统在 1M 上下文配置下,使用 512 张 GPU,约四天可以完成 1T token 的训练。支撑研发运行的基础设施还包括沙箱、算力和权限管理平台,公司称其每周支持近千万次沙箱运行,峰值并发达到十万个。


这些细节让「AI 参与研发」有了具体内容:它需要理解计算依赖,找到数值或性能问题,再通过实验判断修改是否有效。研究员负责设定约束和作出关键决策,AI 承担大量分析、实现与验证工作。


同样的研发方式,也延伸到了接下来的推理系统优化与世界模型研究中。


两个 Demo 案例:


AI4AI 能力有多强?


NaiveRT 和 AutoWM 提供了两个具体观察窗口,分别展示了 AI 在底层系统优化和跨领域研究中的参与方式。


NaiveRT 是一个推理运行时。


它针对长程强化学习任务中的一个实际问题:单条任务轨迹可能需要持续生成大量 token,少数耗时特别长的轨迹,就可能拖住整个训练批次。提高单条序列的解码速度,有望缩短这些样本的等待时间。


围绕这个目标,研究员与 AI 在六天内推进了 151 轮优化实验,其中 63 轮的改动被采纳。AI 分析整网性能,实现候选方案,再通过数值验证和多卡测试检查结果,优化涉及算子融合、数据搬运和 GPU 执