2026年8月31日,Google 官方博客公布了一组将 Antigravity 与 Gemini 3.7 Flash 配对使用的多智能体成果。公告源头是 Antigravity 中 Teamwork 框架的一次功能更新。官方将 Teamwork 描述为一个“允许自治 AI 代理团队协作、批评、迭代数小时或数天”的框架,而配对 Gemini 3.7 Flash 之后,官方称其在数学、系统软件和开源优化三个方向上取得了可验证的进展。
先厘清官方到底公布了什么。
数学与理论计算机科学:七个开放问题,Lean 形式化验证
官方称,该组合解决了 FOCS、JMLR 等顶级会议与期刊上的七个开放问题,其中包括 Knuth 的 Cycles Conjecture——它在 Lean 中完成形式化验证,证明超过 40 页;此外还覆盖稀疏凸优化、可证明的 LLM 量化、前缀矩阵分解等课题;在 TCSBench 上获得 71% 的成绩。
这组结果的关键不在于“AI 能做数学题”,而在于验证方式。Knuth Cycles Conjecture 的证明在 Lean 中形式化验证,这是一种机器可检查的证明路径,不依赖模型对自身输出的自信度。对研究型任务而言,将模型生成内容绑定到外部验证器,是结果可信度的分水岭。相比之下,TCSBench 的 71% 因官方未公布测评细节与基线,目前只能作为参考指标,无法据此横向比较。
系统工程:从零构建能启动 xv6 的 RISC-V 模拟器
官方公布的第二个成果是:从零构建了一个周期精确、乱序执行的 RISC-V CPU 模拟器,并成功将 xv6 操作系统启动到 shell,与硬件 ground truth 的周期对齐误差为 0.71%。
这个任务的工程性质与数学定理完全不同。周期精确模拟器要在指令时序、流水线行为和内存子系统层面逼近真实硬件;“启动 xv6 到 shell”则意味着模拟器必须正确执行完整的操作系统引导链路。0.71% 的周期对齐误差是一个明确的量化结果,但官方没有说明验证覆盖的指令集范围、测试程序和运行时长,因此这个数字的适用边界尚需进一步验证。
开源软件:性能优化进入上游
第三个方向是开源性能优化。官方称已向上游核心库提交优化,包括 Eigen 的 SIMD 快速路径,以及 ParlayHash——后者的插入吞吐量提升至 2 倍,内存占用减少 25%。
这里值得注意的信号是“上游”二字。Eigen 和 ParlayHash 不是临时测试项目,而是有独立维护流程的开源库;优化改动被上游接受,意味着它通过了目标项目的审查和基准测试。从工程角度看,这比自建 benchmark 多了一层外部背书。不过,具体提交内容、测试环境和硬件平台尚未披露,复现条件未知。
三组成果的共同逻辑:外部验证闭环
将三组成果放在一起,可以看到一个共同模式:每项任务都在交付点设置了独立于生成模型的验证环节。
数学定理 → Lean 形式化证明;
CPU 模拟器 → 与硬件 ground truth 对比周期误差;
开源优化 → 上游维护者审查与项目基准测试。
这些验证环节的价值是校准。多智能体系统在数小时甚至数天的自主迭代中,如果没有外部验证器持续纠偏,错误会被层层放大。官方公布的结果之所以重要,不是因为智能体“能跑”,而是因为有证据显示这套组合在开放问题级别上生产出了可验证的产出。对工程团队而言,这种“生成 + 验证”的闭环结构,比模型本身更值得研究。
需要保持谨慎的地方
在采信这些成果之前,有几个边界必须明确。官方没有公布多智能体团队的代理数量、角色分工、模型调用量与计算资源,无法评估成本效率;没有提供 Teamwork 的 API、配置方式或验证工具接入方法,开发者无法从公告中获得实施路径;七个开放问题的完整清单与公开位置未列出;TCSBench 71% 的测评集和基线未知;CPU 模拟器的验证覆盖范围没有展开;Eigen 与 ParlayHash 提交的具体代码、测试环境和复现方式也未给出。
这些都是“结论是否可以迁移”的关键变量。在官方发布更详细的技术说明之前,合理的做法是将其视为方向性证据,而不是可复现方案。
对开发者的实际参考
在等待更多细节的同时,这次公告提供了几个可执行的思考方向。
其一,为多智能体任务提前定义外部验证标准。形式化证明、仿真对照、基准测试、上游审查,都是比模型自评更可靠的验收信号。任务启动时没有验证器,任务结束时将无法判断自主迭代是收敛还是发散。
其二,把长周期自主协作用在真正复杂的任务上。官方明确 Teamwork 支持跨小时甚至跨天的迭代,这意味着它面向的不是单轮问答,而是需要反复试错、验证和修正的长期问题。这类任务才值得付出编排成本。
其三,关注任务之间的异质性。数学证明、CPU 模拟器、开源性能优化三者对智能体的要求并不相同——前者侧重逻辑搜索,中者侧重系统级理解,后者侧重代码级优化。官方用同一个框架展示了跨领域的覆盖面,但还不足以证明每个领域都能达到相同的成功率。
总体来看,Google 这次披露的不是某个模型的单点能力,而是“多智能体框架 + 模型 + 外部验证器”的完整链路。对工程师来说,这条链路中每个环节都可以独立评估和复刻。下一步更有价值的动作,是等待官方开放 Teamwork 配置、API 与验证工具接入文档,之后在自己的任务上重新测量,而不是直接照搬这份成果清单。