智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
GPT-5.6进Kiro:82%成本降幅怎么测

GPT-5.6进Kiro:82%成本降幅怎么测

OpenAI 8 月 24 日公布 GPT-5.6 Sol、Terra、Luna 已进入 AWS Kiro,并给出一个很具体的数据:在 Terminal-Bench 2.1 上,**GPT-5.6 Terra 在 Kiro 环境里完成成功任务的成本约下降 82%**。

176 29 0 1天前
S3数据不搬家,Agent先补语义层

S3数据不搬家,Agent先补语义层

Google Cloud 8 月 24 日公开的 SOAP Architecture 提供了另一条路径:**数据可以继续留在 S3 等原位置,先把访问、语义和业务关系层建立起来,再让 Agent 使用。**

120 18 0 1天前
CHIVE实验证明:看激活值不等于理解模型

CHIVE实验证明:看激活值不等于理解模型

Anthropic 8 月 21 日公布的 CHIVE 结果给了一个很不舒服的反例。

188 26 0 2天前
漏洞没修也能关闭?Mitigated该怎么管

漏洞没修也能关闭?Mitigated该怎么管

GitHub 8 月 20 日给 Code Scanning 新增了一个专门的 dismissal reason:

282 46 0 2天前
CodeQL 2.26.3:Actions污点边界变了

CodeQL 2.26.3:Actions污点边界变了

CodeQL 2.26.3 这次更新里,我最关注的不是新增了多少查询,而是 GitHub Actions 的“可信输入边界”发生了几处很具体的调整。

240 33 0 2天前
Copilot进Teams后,Agent协作不该只剩聊天记录

Copilot进Teams后,Agent协作不该只剩聊天记录

一个 Agent 任务如果持续 20 分钟,参与者有 5 个人,期间改了 8 个文件、跑了 3 轮测试、请求了一次审批,最后只把这些信息折叠成几十条聊天消息,协作成本其实并没有消失,只是从“做事”转移成了“翻记录”。

225 35 0 3天前
Codex App Server:Agent协议为什么选双向JSON-RPC

Codex App Server:Agent协议为什么选双向JSON-RPC

把一个 Agent 嵌进 IDE、桌面应用或者 Web,不是简单暴露一个 `/chat` 接口就够了。

237 44 0 3天前
Claude文本水印:没有隐藏字符,检测靠什么?

Claude文本水印:没有隐藏字符,检测靠什么?

Anthropic 在 8 月 14 日公开 Claude 文本水印方案时,明确否定了这两种理解。

277 43 0 3天前
Stampli 把 243 小时发布工作压到 77 小时:真正值得学的不是“AI 帮市场部写稿”,而是把产品事实做成共享工作流

Stampli 把 243 小时发布工作压到 77 小时:真正值得学的不是“AI 帮市场部写稿”,而是把产品事实做成共享工作流

3.16× faster launch to production

451 72 0 5天前
现在最危险的钓鱼越来越不像“钓鱼”:Google 昨天披露的 OAuth、App Password 和设备绑定攻击,正好给 Agent 身份设计上了一课

现在最危险的钓鱼越来越不像“钓鱼”:Google 昨天披露的 OAuth、App Password 和设备绑定攻击,正好给 Agent 身份设计上了一课

Google Threat Intelligence 昨天公开了一组针对高风险人群的长期攻击活动。

471 77 0 5天前
Google 今天演示了一个会“自我改 Prompt”的 Agent:40% 跑到 90% 之后,它也学会了怎么刷分

Google 今天演示了一个会“自我改 Prompt”的 Agent:40% 跑到 90% 之后,它也学会了怎么刷分

今天 Google Cloud 安排了一场很有意思的 Agent 实验:让一个旅行规划 Agent 自己改自己的规则。

521 95 0 6天前
Claude 这次不是“预测蛋白质”,而是自己跑了 24—48 小时设计实验:1320 个方案里 354 个真结合了

Claude 这次不是“预测蛋白质”,而是自己跑了 24—48 小时设计实验:1320 个方案里 354 个真结合了

8 月 18 日,Anthropic 放出了一份很值得看的实验:不是让 Claude 回答生物学问题,而是让它完整执行一轮 de novo protein binder design。

534 85 0 6天前
OpenAI 这组企业数据让我改了一个判断:AI 落地的分水岭已经不是“有没有账号”,而是有没有把个人用法变成共享工作流

OpenAI 这组企业数据让我改了一个判断:AI 落地的分水岭已经不是“有没有账号”,而是有没有把个人用法变成共享工作流

Codex 占企业客户 Codex + ChatGPT 输出 Token 的 64%

526 88 0 6天前
Anthropic 拉了 45 个 Agent 一起找漏洞:266 个结果很亮眼,但 2700 万 Token 也把“多 Agent 更强”这件事讲复杂了

Anthropic 拉了 45 个 Agent 一起找漏洞:266 个结果很亮眼,但 2700 万 Token 也把“多 Agent 更强”这件事讲复杂了

Agent 可以在论坛里交流,也会互相 Peer Review。最后再由单独的 Arbiter Agent 判断提交的漏洞是不是新的、是不是有效。

509 81 0 6天前
OpenAI 为 Astra 暂停了两周前沿模型 RL:我更在意那 20% 的安全监控算力开销

OpenAI 为 Astra 暂停了两周前沿模型 RL:我更在意那 20% 的安全监控算力开销

8 月 18 日,OpenAI 公布了一件很少见的事:为了加强安全监控,他们**暂停了两周最新待部署模型的强化学习训练**。

586 101 0 7天前
Asana 把一个“要做 5 年”的前端迁移压到 2 周:最反常识的细节是 Prompt 只有 5 句话

Asana 把一个“要做 5 年”的前端迁移压到 2 周:最反常识的细节是 Prompt 只有 5 句话

昨天 OpenAI 公布了一个很适合工程团队研究的 Codex 案例。

507 76 0 7天前
OpenAI 8月18日新版 Model Spec:做 Agent 的人最该盯住的其实是“无权限数据”和副作用

OpenAI 8月18日新版 Model Spec:做 Agent 的人最该盯住的其实是“无权限数据”和副作用

8 月 18 日,OpenAI 更新了 Model Spec。

580 90 0 7天前
两天找到 100+ 个 Critical 漏洞、已经拿到 12 个 CVE:Google/Mandiant 这套多 Agent 代码审计真正值得抄的是“怀疑链”

两天找到 100+ 个 Critical 漏洞、已经拿到 12 个 CVE:Google/Mandiant 这套多 Agent 代码审计真正值得抄的是“怀疑链”

昨天 Google Threat Intelligence Group 公开了一套内部使用了 10 个月的系统:**Agentic Vulnerability Discovery Harness,AVDH**。

602 93 0 7天前
Claude 旧 Workbench 昨天正式退役:最麻烦的不是页面没了,而是 Prompt 和 Eval 资产可能跟着断档

Claude 旧 Workbench 昨天正式退役:最麻烦的不是页面没了,而是 Prompt 和 Eval 资产可能跟着断档

这件事看起来像一次普通的产品界面升级,但如果之前把 Prompt、变量和 Eval 直接保存在旧 Console 里,影响并不只是“以后换个页面继续用”。

594 93 0 8天前
OpenAI 昨天说“防守窗口正在收窄”:真正该紧张的不是零日,而是仓库里那堆没人管的旧东西

OpenAI 昨天说“防守窗口正在收窄”:真正该紧张的不是零日,而是仓库里那堆没人管的旧东西

昨天 OpenAI 发了一篇安全文章,标题叫《The Defender’s Window》。

755 114 0 8天前

精选推荐

1 ReAct、Plan-Execute-Review与状态图Agent怎么选? 1262 2 Agent Planner输出计划存在循环依赖?DAG校验与自动修复排查 1225 3 Human-in-the-Loop审批超时后任务丢失?等待状态与恢复令牌排查 1214 4 手搓生产级 AI Agent 系统(8):Planner、Executor与Reviewer闭环 1187 5 Reviewer为什么让Agent无限修改?接受阈值、最大轮次与差异检测排查 1166 6 Agent从Checkpoint恢复后为什么重复调用工具?步骤提交与副作用幂等排查 1131 7 用Python实现Planner-Executor-Reviewer状态机Agent 1078 8 手搓生产级 AI Agent 系统(9):Checkpoint、Human-in-the-Loop与断点恢复 1073 9 数据库Checkpoint、事件溯源与工作流引擎怎么选?Agent持久化指南 1070 10 用Spring Boot搭建Agent Checkpoint服务:保存、恢复、审批与重放 1066 11 并行Sub-Agent为什么让Token成本暴涨?并发、上下文复制与预算排查 1044 12 Supervisor、Handoff与Blackboard怎么选?多Agent协作模式指南 990 13 多Agent协作时为什么总是传递旧上下文?状态版本与消息边界排查 981 14 Code Interpreter临时文件为什么泄露到其他任务?工作目录与生命周期排查 978 15 手搓生产级 AI Agent 系统(10):多Agent协作、Supervisor与共享状态 971 16 手搓生产级 AI Agent 系统(11):代码与浏览器沙箱、安全执行与风险控制 965 17 Browser Agent遇到验证码和登录循环怎么办?会话、人工接管与站点策略排查 948 18 用Spring Boot实现预算感知的多Agent编排器 923 19 用Spring Boot搭建Agent安全执行网关:代码沙箱、浏览器会话与审计 912 20 容器沙箱、MicroVM与远程执行服务怎么选?Agent代码执行架构指南 894