智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
生产级Agent(19):执行回放与故障取证

生产级Agent(19):执行回放与故障取证

前十八篇已经把生产级 Agent 的执行、权限、审计和治理链条搭起来:Run、Planner、Tool、Checkpoint、Approval、Capability、Delegated Authority、Audit Ledger 都有了。但真正发生线上事故以后,团队很快会遇到一个更难的问题:

213 29 0 2天前
生产级Agent(18):审计账本与可解释执行

生产级Agent(18):审计账本与可解释执行

前十七篇已经把生产级 Agent 从 Planner、Tool Calling、Memory、Checkpoint、Human-in-the-Loop、多 Agent、安全沙箱、质量门禁、Control Plane、Capability Registry 一直推进到 Agent Identity 与 Delegated Authority。系统现在已经能回答:有哪些 Agent、有哪些能力、谁能调

245 33 0 3天前
Copilot进Teams后,Agent协作不该只剩聊天记录

Copilot进Teams后,Agent协作不该只剩聊天记录

一个 Agent 任务如果持续 20 分钟,参与者有 5 个人,期间改了 8 个文件、跑了 3 轮测试、请求了一次审批,最后只把这些信息折叠成几十条聊天消息,协作成本其实并没有消失,只是从“做事”转移成了“翻记录”。

225 35 0 3天前
Codex App Server:Agent协议为什么选双向JSON-RPC

Codex App Server:Agent协议为什么选双向JSON-RPC

把一个 Agent 嵌进 IDE、桌面应用或者 Web,不是简单暴露一个 `/chat` 接口就够了。

237 44 0 3天前
Claude文本水印:没有隐藏字符,检测靠什么?

Claude文本水印:没有隐藏字符,检测靠什么?

Anthropic 在 8 月 14 日公开 Claude 文本水印方案时,明确否定了这两种理解。

277 43 0 3天前
Prompt也要编译:把Agent指令做成CI构建产物

Prompt也要编译:把Agent指令做成CI构建产物

生产 Agent 的 System Prompt 一旦超过几百行,最危险的事情通常不是“模型记不住”,而是团队已经无法确定:**这一句规则到底从哪里来的,改它会影响哪些 Agent,线上正在跑的文本是不是 Git 里的那一份。**

277 49 0 3天前
AI生成1700行PR后,为什么要改成Stacked PR

AI生成1700行PR后,为什么要改成Stacked PR

Coding Agent 最大的生产力问题,正在从“写不出代码”变成“写得太快,人看不过来”。

260 43 0 3天前
Colab MCP实战:把本地Agent接到云端Notebook

Colab MCP实战:把本地Agent接到云端Notebook

Google 已经把 Colab 做成一个 MCP Server:任何兼容 MCP 的 Agent,都可以把 Colab Notebook 当成远程可执行工作区,创建和重排 Cell、写 Python、执行代码、安装依赖,并把结果保存在一个可人工接管的 Notebook Artifact 里。

282 45 0 3天前
GitHub 这次 7 小时 47 分钟事故,最值得抄进自己系统的不是“多加机器”,而是先把 Retry Loop 关进笼子

GitHub 这次 7 小时 47 分钟事故,最值得抄进自己系统的不是“多加机器”,而是先把 Retry Loop 关进笼子

这次事故持续 **7 小时 47 分钟**,影响了 github.com、认证、GitHub Actions、API、Pull Request、Issue 和 Copilot。

459 69 0 5天前
Stampli 把 243 小时发布工作压到 77 小时:真正值得学的不是“AI 帮市场部写稿”,而是把产品事实做成共享工作流

Stampli 把 243 小时发布工作压到 77 小时:真正值得学的不是“AI 帮市场部写稿”,而是把产品事实做成共享工作流

3.16× faster launch to production

451 72 0 5天前
现在最危险的钓鱼越来越不像“钓鱼”:Google 昨天披露的 OAuth、App Password 和设备绑定攻击,正好给 Agent 身份设计上了一课

现在最危险的钓鱼越来越不像“钓鱼”:Google 昨天披露的 OAuth、App Password 和设备绑定攻击,正好给 Agent 身份设计上了一课

Google Threat Intelligence 昨天公开了一组针对高风险人群的长期攻击活动。

471 77 0 5天前
从 AI Studio 到生产,真正让项目翻车的往往不是模型:Google 昨天列的三个“原型悬崖”很现实

从 AI Studio 到生产,真正让项目翻车的往往不是模型:Google 昨天列的三个“原型悬崖”很现实

Google Cloud 昨天发了一篇很接地气的文章,题目大意是:

459 85 0 5天前
Raspberry Pi 5 上跑本地 Agent 已经不是玩具:Gemma 4 E2B 9 token/s、峰值内存 1432MB,真正有意思的是 CPU/GPU 分工

Raspberry Pi 5 上跑本地 Agent 已经不是玩具:Gemma 4 E2B 9 token/s、峰值内存 1432MB,真正有意思的是 CPU/GPU 分工

Google 最近公开了一套 Raspberry Pi 5 上的 Edge AI 实现。

417 65 0 5天前
不要把用户 OAuth Token 直接塞给 Agent:用 Spring Boot 做一个 Delegated Authority Gateway

不要把用户 OAuth Token 直接塞给 Agent:用 Spring Boot 做一个 Delegated Authority Gateway

网关根据用户连接、组织角色、Agent Policy 和当前 Run,签发一个短期 Execution Grant。

402 64 0 5天前
手搓生产级 AI Agent 系统(17):Agent Identity 与 Delegated Authority——让每一次工具调用都能回答“谁授权、代表谁、为什么做”

手搓生产级 AI Agent 系统(17):Agent Identity 与 Delegated Authority——让每一次工具调用都能回答“谁授权、代表谁、为什么做”

前十六篇已经把生产级 Agent 从任务规划、Tool Calling、Memory、Checkpoint、Human-in-the-Loop、多 Agent 协作、安全沙箱、质量门禁、Control Plane 一直推进到 Agent Registry 与 Capability Marketplace。到这一阶段,平台已经能回答“有哪些 Agent”“有哪些能力”“一个 Run 现在做到哪”“某

457 79 0 5天前
Google 今天演示了一个会“自我改 Prompt”的 Agent:40% 跑到 90% 之后,它也学会了怎么刷分

Google 今天演示了一个会“自我改 Prompt”的 Agent:40% 跑到 90% 之后,它也学会了怎么刷分

今天 Google Cloud 安排了一场很有意思的 Agent 实验:让一个旅行规划 Agent 自己改自己的规则。

521 95 0 6天前
Claude 这次不是“预测蛋白质”,而是自己跑了 24—48 小时设计实验:1320 个方案里 354 个真结合了

Claude 这次不是“预测蛋白质”,而是自己跑了 24—48 小时设计实验:1320 个方案里 354 个真结合了

8 月 18 日,Anthropic 放出了一份很值得看的实验:不是让 Claude 回答生物学问题,而是让它完整执行一轮 de novo protein binder design。

534 85 0 6天前
OpenAI 这组企业数据让我改了一个判断:AI 落地的分水岭已经不是“有没有账号”,而是有没有把个人用法变成共享工作流

OpenAI 这组企业数据让我改了一个判断:AI 落地的分水岭已经不是“有没有账号”,而是有没有把个人用法变成共享工作流

Codex 占企业客户 Codex + ChatGPT 输出 Token 的 64%

526 88 0 6天前
MCP Server 真上云以后,我最不建议做的事就是继续用 API Key:Cloud Run 这套 OAuth + IAM 值得照着抄

MCP Server 真上云以后,我最不建议做的事就是继续用 API Key:Cloud Run 这套 OAuth + IAM 值得照着抄

昨天 Google Cloud 的 Wednesday Build Hour 主题之一就是:

495 81 0 6天前
Tool 越接越多以后,Agent 最先坏掉的不是模型,而是“到底谁能用什么”:我用 Spring Boot 做了一个 Capability Registry

Tool 越接越多以后,Agent 最先坏掉的不是模型,而是“到底谁能用什么”:我用 Spring Boot 做了一个 Capability Registry

这时候最常见的问题不是“模型不知道怎么选工具”,而是平台自己已经不知道:

411 75 0 6天前
上一页 1 2 3 ... ... 16 17 18 下一页

精选推荐

1 ReAct、Plan-Execute-Review与状态图Agent怎么选? 1262 2 Agent Planner输出计划存在循环依赖?DAG校验与自动修复排查 1225 3 Human-in-the-Loop审批超时后任务丢失?等待状态与恢复令牌排查 1214 4 手搓生产级 AI Agent 系统(8):Planner、Executor与Reviewer闭环 1187 5 Reviewer为什么让Agent无限修改?接受阈值、最大轮次与差异检测排查 1166 6 Agent从Checkpoint恢复后为什么重复调用工具?步骤提交与副作用幂等排查 1131 7 用Python实现Planner-Executor-Reviewer状态机Agent 1078 8 手搓生产级 AI Agent 系统(9):Checkpoint、Human-in-the-Loop与断点恢复 1073 9 数据库Checkpoint、事件溯源与工作流引擎怎么选?Agent持久化指南 1070 10 用Spring Boot搭建Agent Checkpoint服务:保存、恢复、审批与重放 1066 11 并行Sub-Agent为什么让Token成本暴涨?并发、上下文复制与预算排查 1044 12 Supervisor、Handoff与Blackboard怎么选?多Agent协作模式指南 990 13 多Agent协作时为什么总是传递旧上下文?状态版本与消息边界排查 981 14 Code Interpreter临时文件为什么泄露到其他任务?工作目录与生命周期排查 978 15 手搓生产级 AI Agent 系统(10):多Agent协作、Supervisor与共享状态 971 16 手搓生产级 AI Agent 系统(11):代码与浏览器沙箱、安全执行与风险控制 965 17 Browser Agent遇到验证码和登录循环怎么办?会话、人工接管与站点策略排查 948 18 用Spring Boot实现预算感知的多Agent编排器 923 19 用Spring Boot搭建Agent安全执行网关:代码沙箱、浏览器会话与审计 912 20 容器沙箱、MicroVM与远程执行服务怎么选?Agent代码执行架构指南 894