GPT-5.6进Kiro:82%成本降幅怎么测
OpenAI 8 月 24 日公布 GPT-5.6 Sol、Terra、Luna 已进入 AWS Kiro,并给出一个很具体的数据:在 Terminal-Bench 2.1 上,**GPT-5.6 Terra 在 Kiro 环境里完成成功任务的成本约下降 82%**。
S3数据不搬家,Agent先补语义层
Google Cloud 8 月 24 日公开的 SOAP Architecture 提供了另一条路径:**数据可以继续留在 S3 等原位置,先把访问、语义和业务关系层建立起来,再让 Agent 使用。**
CHIVE实验证明:看激活值不等于理解模型
Anthropic 8 月 21 日公布的 CHIVE 结果给了一个很不舒服的反例。
漏洞没修也能关闭?Mitigated该怎么管
GitHub 8 月 20 日给 Code Scanning 新增了一个专门的 dismissal reason:
CodeQL 2.26.3:Actions污点边界变了
CodeQL 2.26.3 这次更新里,我最关注的不是新增了多少查询,而是 GitHub Actions 的“可信输入边界”发生了几处很具体的调整。
Copilot进Teams后,Agent协作不该只剩聊天记录
一个 Agent 任务如果持续 20 分钟,参与者有 5 个人,期间改了 8 个文件、跑了 3 轮测试、请求了一次审批,最后只把这些信息折叠成几十条聊天消息,协作成本其实并没有消失,只是从“做事”转移成了“翻记录”。
Codex App Server:Agent协议为什么选双向JSON-RPC
把一个 Agent 嵌进 IDE、桌面应用或者 Web,不是简单暴露一个 `/chat` 接口就够了。
Claude文本水印:没有隐藏字符,检测靠什么?
Anthropic 在 8 月 14 日公开 Claude 文本水印方案时,明确否定了这两种理解。
Stampli 把 243 小时发布工作压到 77 小时:真正值得学的不是“AI 帮市场部写稿”,而是把产品事实做成共享工作流
3.16× faster launch to production
现在最危险的钓鱼越来越不像“钓鱼”:Google 昨天披露的 OAuth、App Password 和设备绑定攻击,正好给 Agent 身份设计上了一课
Google Threat Intelligence 昨天公开了一组针对高风险人群的长期攻击活动。
Google 今天演示了一个会“自我改 Prompt”的 Agent:40% 跑到 90% 之后,它也学会了怎么刷分
今天 Google Cloud 安排了一场很有意思的 Agent 实验:让一个旅行规划 Agent 自己改自己的规则。
Claude 这次不是“预测蛋白质”,而是自己跑了 24—48 小时设计实验:1320 个方案里 354 个真结合了
8 月 18 日,Anthropic 放出了一份很值得看的实验:不是让 Claude 回答生物学问题,而是让它完整执行一轮 de novo protein binder design。
OpenAI 这组企业数据让我改了一个判断:AI 落地的分水岭已经不是“有没有账号”,而是有没有把个人用法变成共享工作流
Codex 占企业客户 Codex + ChatGPT 输出 Token 的 64%
Anthropic 拉了 45 个 Agent 一起找漏洞:266 个结果很亮眼,但 2700 万 Token 也把“多 Agent 更强”这件事讲复杂了
Agent 可以在论坛里交流,也会互相 Peer Review。最后再由单独的 Arbiter Agent 判断提交的漏洞是不是新的、是不是有效。
OpenAI 为 Astra 暂停了两周前沿模型 RL:我更在意那 20% 的安全监控算力开销
8 月 18 日,OpenAI 公布了一件很少见的事:为了加强安全监控,他们**暂停了两周最新待部署模型的强化学习训练**。
Asana 把一个“要做 5 年”的前端迁移压到 2 周:最反常识的细节是 Prompt 只有 5 句话
昨天 OpenAI 公布了一个很适合工程团队研究的 Codex 案例。
OpenAI 8月18日新版 Model Spec:做 Agent 的人最该盯住的其实是“无权限数据”和副作用
8 月 18 日,OpenAI 更新了 Model Spec。
两天找到 100+ 个 Critical 漏洞、已经拿到 12 个 CVE:Google/Mandiant 这套多 Agent 代码审计真正值得抄的是“怀疑链”
昨天 Google Threat Intelligence Group 公开了一套内部使用了 10 个月的系统:**Agentic Vulnerability Discovery Harness,AVDH**。
Claude 旧 Workbench 昨天正式退役:最麻烦的不是页面没了,而是 Prompt 和 Eval 资产可能跟着断档
这件事看起来像一次普通的产品界面升级,但如果之前把 Prompt、变量和 Eval 直接保存在旧 Console 里,影响并不只是“以后换个页面继续用”。
OpenAI 昨天说“防守窗口正在收窄”:真正该紧张的不是零日,而是仓库里那堆没人管的旧东西
昨天 OpenAI 发了一篇安全文章,标题叫《The Defender’s Window》。