智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
Anthropic 拉了 45 个 Agent 一起找漏洞:266 个结果很亮眼,但 2700 万 Token 也把“多 Agent 更强”这件事讲复杂了

Anthropic 拉了 45 个 Agent 一起找漏洞:266 个结果很亮眼,但 2700 万 Token 也把“多 Agent 更强”这件事讲复杂了

Agent 可以在论坛里交流,也会互相 Peer Review。最后再由单独的 Arbiter Agent 判断提交的漏洞是不是新的、是不是有效。

509 81 0 6天前
手搓生产级 AI Agent 系统(16):Agent Registry 与 Capability Marketplace——让 Tool、Skill、MCP 和 Agent 可以被发现、授权与复用

手搓生产级 AI Agent 系统(16):Agent Registry 与 Capability Marketplace——让 Tool、Skill、MCP 和 Agent 可以被发现、授权与复用

前十五篇已经把生产级 Agent 从单体运行扩展到了 Planner、Tool Calling、Memory、Checkpoint、Human-in-the-Loop、多 Agent 协作、安全沙箱、评测发布和 Control Plane。系统现在已经能“管住 Agent”,但随着 Agent、Tool、Skill、MCP Server 和 Workflow 数量增长,新的问题开始出现:能力散落在

461 72 0 6天前
OpenAI 为 Astra 暂停了两周前沿模型 RL:我更在意那 20% 的安全监控算力开销

OpenAI 为 Astra 暂停了两周前沿模型 RL:我更在意那 20% 的安全监控算力开销

8 月 18 日,OpenAI 公布了一件很少见的事:为了加强安全监控,他们**暂停了两周最新待部署模型的强化学习训练**。

586 101 0 7天前
Asana 把一个“要做 5 年”的前端迁移压到 2 周:最反常识的细节是 Prompt 只有 5 句话

Asana 把一个“要做 5 年”的前端迁移压到 2 周:最反常识的细节是 Prompt 只有 5 句话

昨天 OpenAI 公布了一个很适合工程团队研究的 Codex 案例。

507 76 0 7天前
OpenAI 8月18日新版 Model Spec:做 Agent 的人最该盯住的其实是“无权限数据”和副作用

OpenAI 8月18日新版 Model Spec:做 Agent 的人最该盯住的其实是“无权限数据”和副作用

8 月 18 日,OpenAI 更新了 Model Spec。

580 90 0 7天前
Box 开始把表格、图表和整页 PDF 直接塞进同一个向量空间:传统 RAG 的“先转纯文本”正在过时

Box 开始把表格、图表和整页 PDF 直接塞进同一个向量空间:传统 RAG 的“先转纯文本”正在过时

昨天 Google Cloud 和 Box 公布了 Gemini Multimodal Embeddings 2 在 Box Agentic Platform 里的一个企业级落地方向。

512 90 0 7天前
别把每条 Kafka 消息都扔给 Agent:高吞吐 AI 流水线真正省钱的地方,是先把 90% 的普通事件挡在模型外

别把每条 Kafka 消息都扔给 Agent:高吞吐 AI 流水线真正省钱的地方,是先把 90% 的普通事件挡在模型外

昨天 Google Cloud 写了一篇很“工程”的文章:用 Dataflow + Agent Development Kit 做高吞吐生成式 AI 流水线。

668 105 0 7天前
两天找到 100+ 个 Critical 漏洞、已经拿到 12 个 CVE:Google/Mandiant 这套多 Agent 代码审计真正值得抄的是“怀疑链”

两天找到 100+ 个 Critical 漏洞、已经拿到 12 个 CVE:Google/Mandiant 这套多 Agent 代码审计真正值得抄的是“怀疑链”

昨天 Google Threat Intelligence Group 公开了一套内部使用了 10 个月的系统:**Agentic Vulnerability Discovery Harness,AVDH**。

602 93 0 7天前
手搓生产级 AI Agent 系统(15):Agent Control Plane——目录、运行、成本、审批与反馈统一治理

手搓生产级 AI Agent 系统(15):Agent Control Plane——目录、运行、成本、审批与反馈统一治理

前十四篇已经把生产级 Agent 的大部分“局部能力”补齐了:模型路由、Tool Calling、Planner、Reviewer、Checkpoint、Human-in-the-Loop、多 Agent、代码与浏览器沙箱、评测发布、Agent as Code。

613 98 0 7天前
Claude 旧 Workbench 昨天正式退役:最麻烦的不是页面没了,而是 Prompt 和 Eval 资产可能跟着断档

Claude 旧 Workbench 昨天正式退役:最麻烦的不是页面没了,而是 Prompt 和 Eval 资产可能跟着断档

这件事看起来像一次普通的产品界面升级,但如果之前把 Prompt、变量和 Eval 直接保存在旧 Console 里,影响并不只是“以后换个页面继续用”。

594 93 0 8天前
Claude 连续两天出故障以后,我重新看了一遍“多模型容灾”这件事

Claude 连续两天出故障以后,我重新看了一遍“多模型容灾”这件事

Anthropic Status Page 记录的范围包括 claude.ai、platform.claude.com、Claude API、Claude Code 和 Claude Cowork。

633 110 0 8天前
聊天窗口很适合告诉 Agent“我要什么”,但真的不适合看它“干到哪了”

聊天窗口很适合告诉 Agent“我要什么”,但真的不适合看它“干到哪了”

昨天 GitHub 发了一篇挺有意思的文章,题目直接点出了一个越来越明显的问题:

601 97 0 8天前
OpenAI 昨天说“防守窗口正在收窄”:真正该紧张的不是零日,而是仓库里那堆没人管的旧东西

OpenAI 昨天说“防守窗口正在收窄”:真正该紧张的不是零日,而是仓库里那堆没人管的旧东西

昨天 OpenAI 发了一篇安全文章,标题叫《The Defender’s Window》。

755 114 0 8天前
把 80 屏 Agent 日志变成一张图:Spring Boot SSE + React Flow 的 Run Canvas 实现

把 80 屏 Agent 日志变成一张图:Spring Boot SSE + React Flow 的 Run Canvas 实现

前一篇聊到一个我很认同的方向:复杂 Agent 不能只靠聊天窗口展示状态。

597 89 0 8天前
50+ 个 Agent 上线、310 人在用:ABC Legal 最值得抄的不是 Claude,而是把 Agent 当软件管理

50+ 个 Agent 上线、310 人在用:ABC Legal 最值得抄的不是 Claude,而是把 Agent 当软件管理

昨天 Anthropic 公布了一个我觉得很值得企业团队认真看的案例。

613 92 0 8天前
手搓生产级 AI Agent 系统(14):Agent as Code——Prompt、Tool、Schedule、Memory 全部进 Git

手搓生产级 AI Agent 系统(14):Agent as Code——Prompt、Tool、Schedule、Memory 全部进 Git

前面十三篇已经把生产级 Agent 的关键运行能力补得差不多了:任务规划、Tool Calling、状态管理、Checkpoint、Human-in-the-Loop、多 Agent 协作、安全沙箱、质量门禁、模型路由、预算和降级。

720 112 0 8天前
Gemini 3.7 Flash 刚发布:我更在意的不是跑分,而是 $0.75 输入价把 Agent 成本线往下压了一截

Gemini 3.7 Flash 刚发布:我更在意的不是跑分,而是 $0.75 输入价把 Agent 成本线往下压了一截

8 月 13 日,Google 发布了 Gemini 3.7 Flash。

720 118 0 9天前
8月26日 o3 从 ChatGPT 下线:别急着改 API,你真正要检查的是这 6 类使用习惯

8月26日 o3 从 ChatGPT 下线:别急着改 API,你真正要检查的是这 6 类使用习惯

OpenAI 已确认:**o3 将在 2026 年 8 月 26 日从 ChatGPT 退役**。这次变化只影响 ChatGPT 中的模型选择,OpenAI 官方同时明确说明,API 不受此次退役影响。

654 98 0 9天前
Kimi K3 权重放出来以后,国产大模型竞争开始变成另一场游戏

Kimi K3 权重放出来以后,国产大模型竞争开始变成另一场游戏

7 月底 Kimi K3 的完整权重公开后,我觉得国产大模型的竞争已经出现了一个明显变化。

749 119 0 9天前
GPT-5.6、Claude Opus 5、Gemini 3.7 Flash:我不会按总榜选模型

GPT-5.6、Claude Opus 5、Gemini 3.7 Flash:我不会按总榜选模型

过去两个月,模型选型越来越像一件“看起来容易、实际上很容易选错”的事。

755 121 0 9天前

精选推荐

1 ReAct、Plan-Execute-Review与状态图Agent怎么选? 1262 2 Agent Planner输出计划存在循环依赖?DAG校验与自动修复排查 1225 3 Human-in-the-Loop审批超时后任务丢失?等待状态与恢复令牌排查 1214 4 手搓生产级 AI Agent 系统(8):Planner、Executor与Reviewer闭环 1187 5 Reviewer为什么让Agent无限修改?接受阈值、最大轮次与差异检测排查 1166 6 Agent从Checkpoint恢复后为什么重复调用工具?步骤提交与副作用幂等排查 1131 7 用Python实现Planner-Executor-Reviewer状态机Agent 1078 8 手搓生产级 AI Agent 系统(9):Checkpoint、Human-in-the-Loop与断点恢复 1073 9 数据库Checkpoint、事件溯源与工作流引擎怎么选?Agent持久化指南 1070 10 用Spring Boot搭建Agent Checkpoint服务:保存、恢复、审批与重放 1066 11 并行Sub-Agent为什么让Token成本暴涨?并发、上下文复制与预算排查 1044 12 Supervisor、Handoff与Blackboard怎么选?多Agent协作模式指南 990 13 多Agent协作时为什么总是传递旧上下文?状态版本与消息边界排查 981 14 Code Interpreter临时文件为什么泄露到其他任务?工作目录与生命周期排查 978 15 手搓生产级 AI Agent 系统(10):多Agent协作、Supervisor与共享状态 971 16 手搓生产级 AI Agent 系统(11):代码与浏览器沙箱、安全执行与风险控制 965 17 Browser Agent遇到验证码和登录循环怎么办?会话、人工接管与站点策略排查 948 18 用Spring Boot实现预算感知的多Agent编排器 923 19 用Spring Boot搭建Agent安全执行网关:代码沙箱、浏览器会话与审计 912 20 容器沙箱、MicroVM与远程执行服务怎么选?Agent代码执行架构指南 894