智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
离线评测分数很高,线上用户为什么仍然不满意?数据分布与任务成功率排查

离线评测分数很高,线上用户为什么仍然不满意?数据分布与任务成功率排查

离线集可能过于干净、静态和均衡,无法覆盖线上噪声、权限、长对话、超时和真实业务结果。

18 1 0 11小时前
离线Benchmark、影子流量与金丝雀评测怎么选?AI质量验证指南

离线Benchmark、影子流量与金丝雀评测怎么选?AI质量验证指南

AI发布前后可以使用离线数据集、影子真实流量和小比例金丝雀,本文比较风险与反馈真实性。

39 6 0 11小时前
LLM-as-a-Judge评分忽高忽低?位置偏差、长度偏差与校准排查

LLM-as-a-Judge评分忽高忽低?位置偏差、长度偏差与校准排查

评审模型会受答案顺序、长度、措辞、自身模型偏好和Rubric模糊影响。

16 3 0 11小时前
用Spring Boot搭建AI发布质量门禁:离线评测、影子流量与金丝雀决策

用Spring Boot搭建AI发布质量门禁:离线评测、影子流量与金丝雀决策

实现统一质量门禁服务,汇总离线报告、影子指标和金丝雀业务结果,输出发布、暂停或回滚决定。

18 3 0 11小时前
AI应用评测与质量保障(1):从离线评测到线上质量门禁

AI应用评测与质量保障(1):从离线评测到线上质量门禁

建立覆盖数据集、规则、Judge、影子流量、金丝雀、用户反馈和发布决策的完整质量体系。

54 11 0 11小时前
Code Interpreter临时文件为什么泄露到其他任务?工作目录与生命周期排查

Code Interpreter临时文件为什么泄露到其他任务?工作目录与生命周期排查

多个任务复用容器、工作目录或缓存时,前一个用户生成的文件可能被后续任务读取。

132 17 0 1天前
容器沙箱、MicroVM与远程执行服务怎么选?Agent代码执行架构指南

容器沙箱、MicroVM与远程执行服务怎么选?Agent代码执行架构指南

Agent代码执行可以使用普通容器、MicroVM或独立远程执行平台,本文比较隔离、启动速度和运维成本。

105 21 0 1天前
Browser Agent遇到验证码和登录循环怎么办?会话、人工接管与站点策略排查

Browser Agent遇到验证码和登录循环怎么办?会话、人工接管与站点策略排查

浏览器Agent在验证码、MFA、会话过期和反自动化策略前可能不断刷新或重试。

112 12 0 1天前
用Spring Boot搭建Agent安全执行网关:代码沙箱、浏览器会话与审计

用Spring Boot搭建Agent安全执行网关:代码沙箱、浏览器会话与审计

实现统一安全执行网关,对代码、浏览器和文件任务应用策略、资源限制、审批和审计。

136 22 0 1天前
手搓生产级 AI Agent 系统(11):代码与浏览器沙箱、安全执行与风险控制

手搓生产级 AI Agent 系统(11):代码与浏览器沙箱、安全执行与风险控制

实现Execution Policy、任务级沙箱、网络与文件限制、浏览器人工接管和Artifact治理。

127 25 0 1天前
多Agent协作时为什么总是传递旧上下文?状态版本与消息边界排查

多Agent协作时为什么总是传递旧上下文?状态版本与消息边界排查

子Agent读取的状态可能是任务开始时快照,而不是其他Agent刚更新的最新结果。

221 36 0 2天前
Supervisor、Handoff与Blackboard怎么选?多Agent协作模式指南

Supervisor、Handoff与Blackboard怎么选?多Agent协作模式指南

多Agent可以由Supervisor集中调度、Agent间直接移交,或通过共享Blackboard协作。

229 35 0 2天前
并行Sub-Agent为什么让Token成本暴涨?并发、上下文复制与预算排查

并行Sub-Agent为什么让Token成本暴涨?并发、上下文复制与预算排查

并行执行会复制System Prompt、工具Schema、历史和检索上下文,Agent数量翻倍时成本可能超过线性增长。

204 33 0 2天前
用Spring Boot实现预算感知的多Agent编排器

用Spring Boot实现预算感知的多Agent编排器

实现Supervisor分解任务、受控并行Worker、版本化共享状态和预算结算。

167 27 0 2天前
手搓生产级 AI Agent 系统(10):多Agent协作、Supervisor与共享状态

手搓生产级 AI Agent 系统(10):多Agent协作、Supervisor与共享状态

实现Agent能力目录、Supervisor、任务DAG、受控并发、共享状态合并和结果聚合。

181 27 0 2天前
Agent从Checkpoint恢复后为什么重复调用工具?步骤提交与副作用幂等排查

Agent从Checkpoint恢复后为什么重复调用工具?步骤提交与副作用幂等排查

Checkpoint保存时间点不正确时,恢复后会重新执行已经产生副作用的工具。

371 62 0 3天前
数据库Checkpoint、事件溯源与工作流引擎怎么选?Agent持久化指南

数据库Checkpoint、事件溯源与工作流引擎怎么选?Agent持久化指南

Agent持久化可以保存最新快照、完整事件或交给工作流引擎管理。本文比较恢复粒度和复杂度。

295 54 0 3天前
Human-in-the-Loop审批超时后任务丢失?等待状态与恢复令牌排查

Human-in-the-Loop审批超时后任务丢失?等待状态与恢复令牌排查

人工审批可能持续小时或数天,不能依赖HTTP连接、内存Future或临时线程等待。

330 46 0 3天前
用Spring Boot搭建Agent Checkpoint服务:保存、恢复、审批与重放

用Spring Boot搭建Agent Checkpoint服务:保存、恢复、审批与重放

实现Agent Checkpoint与人工审批服务,支持状态快照、事件日志、恢复令牌和步骤重放。

246 40 0 3天前
手搓生产级 AI Agent 系统(9):Checkpoint、Human-in-the-Loop与断点恢复

手搓生产级 AI Agent 系统(9):Checkpoint、Human-in-the-Loop与断点恢复

实现步骤级Checkpoint、事件记录、人工审批、中断恢复和副作用幂等。

281 34 0 3天前
1 2 3 ... ... 13 14 15 下一页

精选推荐

1 Prompt约束、StructuredOutputConverter、原生JSON Schema与validateSchema怎么选? 1396 2 Spring AI企业级应用实战(9):结构化输出、JSON Schema、校验、自修复与版本兼容 1354 3 用Spring Boot搭建AI结构化输出网关:Schema注册、校验、自修复与版本治理 1320 4 GPT-Live语音开始加入SynthID水印:企业语音Agent需要做哪些改造? 1299 5 Spring AI Moderation已经返回flagged,为什么模型请求仍然继续执行? 1268 6 欧盟AI法案进入下一阶段:企业AI应用需要补齐哪些治理能力? 1248 7 Spring AI企业级应用实战(8):输入输出安全、Prompt Injection、PII脱敏与人工审批 1241 8 Moderation、DLP、LLM Guardrail和策略引擎怎么选?企业AI安全四层架构指南 1232 9 用Spring AI实现权限感知RAG检索器:租户过滤、文档ACL与引用校验 1226 10 Spring AI配置多个ChatModel后为什么总是调用默认模型? 1210 11 Spring AI企业级应用实战(10):多模型路由、预算控制与故障降级 1195 12 Spring AI流式输出为什么不能直接entity()?聚合JSON、SSE事件与最终对象解析方案 1186 13 RAG文档里藏着“忽略系统提示词”,为什么模型真的照做了?Prompt Injection完整排查 1183 14 Spring AI调用entity()时JSON解析失败?Markdown包裹、字段缺失与Schema不兼容完整排查 1182 15 OpenAI Assistants API将在8月26日关闭:迁移Responses API最后阶段完整清单 1174 16 用Spring Boot搭建企业AI安全网关:输入审核、PII脱敏、输出校验与审计 1173 17 Spring AI企业级应用实战(11):权限感知RAG、多租户过滤与引用治理 1164 18 规则路由、分类模型与Router Agent怎么选?企业多模型调度指南 1163 19 GPT-5.6 Luna降价80%、Terra降价20%:企业AI模型路由应该如何重算? 1157 20 用Spring Boot搭建多模型路由网关:规则、预算、Fallback与审计 1122