Anthropic 官方博客于 2026 年 9 月 24 日发布 Project Swap: What happens when agents trade for us?。实验让 201 名员工用 Claude 驱动的 agent 在迷你书市上交换图书,目的是观察 agent 进入市场后什么有效、什么失效。它是继 Project Deal 之后更可控的续作:Project Deal 让 agent 买卖乒乓球拍、滑雪板等异质商品,但自由议价难以定义“本该多好”;Project Swap 把偏好简化为书单排序,因而能评分。
实验设计上,参与者来自旧金山、纽约、伦敦、西雅图、DC、都柏林六个办公室,本地池从 3 人到 115 人不等,都柏林被排除在多数分析外。每人带来一本想送出的书,并与 Claude 进行简短半结构化对话,谈阅读偏好和夏季想读的书。Claude 用 Fable 5 根据对话为池内每本书构建排序。参与者另外手工对 10 本书排序作为 ground truth,agent 从未看到。评估显示,仅凭五分钟对话,agent 对书籍两两排序与本人匹配 61%。这说明短对话提取偏好已有信号,但并非充分。
交易机制是去中心化的交易地板。agent 初始持有参与者带来的书,目标是换到更合适的。地板有最大墙钟时间和并发限制,避免拥塞。agent 可向共享频道发一条消息,提出交换、接受或拒绝,或只是聊天。交易提案可以是双边互换,也可以是多边轮换;只有所有相关方都接受才执行。整个地板历史,包括谁说了什么和哪些交易执行,都是公开的。每个地板随机一半 agent 被设为 “ruthless”,唯一目标是给自己的参与者换到喜欢的书;另一半为 “prosocial”,主目标相同,但次要目标是让所有人拿到喜欢的书。三周后进行 endline 调查,问满意度,以及是否愿意再次把类似决策交给 agent。
官方还讨论了两种市场。集中市场中,所有人告诉单一主体想要什么,由它计算交易,经济学家早已理解这一点;问题是详细表达偏好太繁琐。若 agent 能从轻松对话中学习偏好,原本太贵而无法集中运行的市场可能变得可行。但集中市场需要清算所,参与者要信任它并执行结果。很多时候没有这样的实体,或人们不愿披露信息,比如求职者不想让中央匹配器知道自己正在找。去中心化市场则可减少寻找对手方和谈判的成本。人类已有房地产经纪人、猎头、媒人,但搜索和谈判消耗稀缺注意力,因此昂贵。AI agent 的注意力远不那么稀缺,若谈判得好,更多人能拥有类似服务。
重跑设计用于区分偶然后果与稳定特征。官方完全重复现场设置,仅改变 agent 抽到的指令;也做所有 agent 用 Fable 5 的版本。为隔离模型效应,给所有 agent 中性指令,分别让全部 agent 跑在 Haiku 4.5、Sonnet 4.5、Opus 4.8、Fable 5 上,共 80 个地板;还跑 60 个混合地板,一半 Opus,一半其他三模型之一。主要结论是:agent 运行在哪个模型上,对谈判结果的影响比给它的指令更大;更强模型的市场更有效率。
关键发现是,市场表现不足,主要不是交易方式问题,而是 agent 缺乏参与者信息。偏好采集与理解成为瓶颈。大多数读到自己书的人喜欢它,平均参与者表示愿意把约三分之一年度图书预算交给 Claude 来花。这显示 agent 代管小额偏好型交易有接受度,但官方强调这只是早期观察。
工程与设计问题被官方明确列出。设计 “agents for markets” 的人,需要验证 agent 是否真正理解参与者;设计 “markets for agents” 的人,需要明确准入规则、交易失败时怎么办、市场活动对参与者可见多少。企业级多 Agent 系统若复制这一模式,应把偏好验证、规则执行、失败处理和可见性审计当作一等工程组件,而不是只优化提示词。模型能力差异也意味着,多 Agent 市场不能把“换模型”当作无关变量,需在评估中固定并报告模型版本与指令策略。
以上实验是受控的图书交换市场,不是生产系统,也未直接给出企业部署方案。它的价值在于把多 Agent 交易中的偏好理解、模型差异、市场规则和参与度问题暴露出来。对于要做 agent 间交易或协作的系统,Project Swap 更像一份风险清单:先解决 agent 是否懂人,再讨论市场是否高效。