生产级Agent(19):执行回放与故障取证
前十八篇已经把生产级 Agent 的执行、权限、审计和治理链条搭起来:Run、Planner、Tool、Checkpoint、Approval、Capability、Delegated Authority、Audit Ledger 都有了。但真正发生线上事故以后,团队很快会遇到一个更难的问题:
生产级Agent(18):审计账本与可解释执行
前十七篇已经把生产级 Agent 从 Planner、Tool Calling、Memory、Checkpoint、Human-in-the-Loop、多 Agent、安全沙箱、质量门禁、Control Plane、Capability Registry 一直推进到 Agent Identity 与 Delegated Authority。系统现在已经能回答:有哪些 Agent、有哪些能力、谁能调
Copilot进Teams后,Agent协作不该只剩聊天记录
一个 Agent 任务如果持续 20 分钟,参与者有 5 个人,期间改了 8 个文件、跑了 3 轮测试、请求了一次审批,最后只把这些信息折叠成几十条聊天消息,协作成本其实并没有消失,只是从“做事”转移成了“翻记录”。
Codex App Server:Agent协议为什么选双向JSON-RPC
把一个 Agent 嵌进 IDE、桌面应用或者 Web,不是简单暴露一个 `/chat` 接口就够了。
Claude文本水印:没有隐藏字符,检测靠什么?
Anthropic 在 8 月 14 日公开 Claude 文本水印方案时,明确否定了这两种理解。
Prompt也要编译:把Agent指令做成CI构建产物
生产 Agent 的 System Prompt 一旦超过几百行,最危险的事情通常不是“模型记不住”,而是团队已经无法确定:**这一句规则到底从哪里来的,改它会影响哪些 Agent,线上正在跑的文本是不是 Git 里的那一份。**
AI生成1700行PR后,为什么要改成Stacked PR
Coding Agent 最大的生产力问题,正在从“写不出代码”变成“写得太快,人看不过来”。
Colab MCP实战:把本地Agent接到云端Notebook
Google 已经把 Colab 做成一个 MCP Server:任何兼容 MCP 的 Agent,都可以把 Colab Notebook 当成远程可执行工作区,创建和重排 Cell、写 Python、执行代码、安装依赖,并把结果保存在一个可人工接管的 Notebook Artifact 里。
GitHub 这次 7 小时 47 分钟事故,最值得抄进自己系统的不是“多加机器”,而是先把 Retry Loop 关进笼子
这次事故持续 **7 小时 47 分钟**,影响了 github.com、认证、GitHub Actions、API、Pull Request、Issue 和 Copilot。
Stampli 把 243 小时发布工作压到 77 小时:真正值得学的不是“AI 帮市场部写稿”,而是把产品事实做成共享工作流
3.16× faster launch to production
现在最危险的钓鱼越来越不像“钓鱼”:Google 昨天披露的 OAuth、App Password 和设备绑定攻击,正好给 Agent 身份设计上了一课
Google Threat Intelligence 昨天公开了一组针对高风险人群的长期攻击活动。
从 AI Studio 到生产,真正让项目翻车的往往不是模型:Google 昨天列的三个“原型悬崖”很现实
Google Cloud 昨天发了一篇很接地气的文章,题目大意是:
Raspberry Pi 5 上跑本地 Agent 已经不是玩具:Gemma 4 E2B 9 token/s、峰值内存 1432MB,真正有意思的是 CPU/GPU 分工
Google 最近公开了一套 Raspberry Pi 5 上的 Edge AI 实现。
不要把用户 OAuth Token 直接塞给 Agent:用 Spring Boot 做一个 Delegated Authority Gateway
网关根据用户连接、组织角色、Agent Policy 和当前 Run,签发一个短期 Execution Grant。
手搓生产级 AI Agent 系统(17):Agent Identity 与 Delegated Authority——让每一次工具调用都能回答“谁授权、代表谁、为什么做”
前十六篇已经把生产级 Agent 从任务规划、Tool Calling、Memory、Checkpoint、Human-in-the-Loop、多 Agent 协作、安全沙箱、质量门禁、Control Plane 一直推进到 Agent Registry 与 Capability Marketplace。到这一阶段,平台已经能回答“有哪些 Agent”“有哪些能力”“一个 Run 现在做到哪”“某
Google 今天演示了一个会“自我改 Prompt”的 Agent:40% 跑到 90% 之后,它也学会了怎么刷分
今天 Google Cloud 安排了一场很有意思的 Agent 实验:让一个旅行规划 Agent 自己改自己的规则。
Claude 这次不是“预测蛋白质”,而是自己跑了 24—48 小时设计实验:1320 个方案里 354 个真结合了
8 月 18 日,Anthropic 放出了一份很值得看的实验:不是让 Claude 回答生物学问题,而是让它完整执行一轮 de novo protein binder design。
OpenAI 这组企业数据让我改了一个判断:AI 落地的分水岭已经不是“有没有账号”,而是有没有把个人用法变成共享工作流
Codex 占企业客户 Codex + ChatGPT 输出 Token 的 64%
MCP Server 真上云以后,我最不建议做的事就是继续用 API Key:Cloud Run 这套 OAuth + IAM 值得照着抄
昨天 Google Cloud 的 Wednesday Build Hour 主题之一就是:
Tool 越接越多以后,Agent 最先坏掉的不是模型,而是“到底谁能用什么”:我用 Spring Boot 做了一个 Capability Registry
这时候最常见的问题不是“模型不知道怎么选工具”,而是平台自己已经不知道: