Anthropic 于 2026 年 6 月 30 日以 beta 版形式推出 Claude Science,一个面向科学家的 AI 工作台。这不是一个简单的聊天工具,而是把科研流程中分散的数据库、文件格式、计算资源和写作环节,统一收进同一个可审计的交互环境。
解决的核心问题:科研流程的碎片化
官方公告点明了一个被多数人低估的问题:科研工作往往较为繁琐,研究人员需要在多个数据库、数据格式和工具之间频繁切换。研究者需要在 PubMed、Jupyter、R、集群终端之间来回切换,处理不同 schema 的数据库,应付需要专门 pipeline 和查看器的文件格式。Claude Science 把这些碎片化工具整合到一个研究环境中,试图让科学家在统一的研究环境中完成文献分析、多步骤研究、图表和手稿迭代。
从工程角度看,这里真正值得关注的是它没有做成云端 SaaS,而是像 Jupyter Notebook 一样,可以在本地或远程运行。官方明确支持 macOS、Linux 本地运行,也支持通过 SSH 连接远程机器或 HPC 登录节点。这意味着实验室现有的计算基础设施可以继续使用,不需要把数据搬到 Anthropic 的服务器上。
可审计产物:不只是生成结果
Claude Science 的关键设计之一是"可审计产物"。官方说明指出,当代理生成一张图或一份手稿时,会同时包含:产生该结果的精确代码、运行环境、生成方式的自然语言描述,以及完整消息历史。这意味着即使几个月后回看,也更容易依据代码、环境、描述和消息历史验证并复现实验过程。
这对科研场景是决定性差异。论文审稿和实验室复现,依赖的不是模型最终输出的答案,而是答案背后的输入、推理过程和可执行代码。一个能自我校正的 reviewer agent 会在 pipeline 运行过程中检查输出,标记错误的引用、无法追溯的数字,以及与底层代码不匹配的图表。
对开发团队而言,可以把这套机制理解为一个"Agent + 环境快照 + 审计日志"的组合。它不是简单地让模型写代码,而是让模型拥有一个持久的运行会话,会话里的代码、数据和上下文可以被随时检查、克隆和复现。
超过 60 个技能与领域连接器
Claude Science 预配置了超过 60 个经过精选的技能和连接器,覆盖基因组学、单细胞、蛋白质组学、结构生物学、化学信息学等领域。用户通过一个通用协调代理与系统交互,这个协调代理可以启动子代理,也可以调用用户创建的专用代理。
官方明确列出了它在生物学场景中对接的数据源:UniProt、PDB、Ensembl、Reactome、ClinVar、ChEMBL、GEO 等。这些数据库各有自己的 schema 和查询语言,普通研究者很难全部掌握。Claude Science 的价值在于,用自然语言提问后,专用代理会自动查询和汇总这些异构数据源。
此外,它还集成了 NVIDIA BioNeMo Agent Toolkit 中的技能,可以连接 Evo 2、Boltz-2、OpenFold3 等生命科学模型和库。这意味着科研人员已经信任的模型和 pipeline 可以继续使用,官方表示可以连接这些已有工具。
算力管理:从笔记本到 HPC 集群
大型分析任务,比如蛋白质折叠或超大规模基因组学 pipeline,通常需要研究者把大量精力花在提交作业、排队等待、检查状态和拉回结果上。Claude Science 设计了一套算力管理机制:
- 代理会先起草一个计算计划
- 在接触新资源前先征询用户同意
- 用户可以在写入和提交任务前审查或撤销任何决定
- 作业提交到实验室已有的计算资源上(通过 SSH 连接自有 HPC 集群,或通过 Modal 账号按需获取计算)
- 分析规模可以从单个 GPU 扩展到数百个 GPU更值得关注的是,代理运行在一个持有上下文内存的活动会话中。官方明确说明,即使非常大的数据集也只需要加载一次,后续处理无需重复加载。同时,大型或敏感数据集可以留在实验室自己的基础设施上,只有每一步分析所需的上下文会被发送给 Claude。对科研团队来说,这个设计直接触及了数据安全和算力成本的痛点。云端 AI 工具再强,如果要求把所有数据上传,很多生物医学研究就无法使用。Claude Science 的设计是"算力可以按需扩展,但数据可以留在实验室自己的基础设施上",这在实际落地中可能比模型能力本身更重要。早期应用案例透露的真实工作流官方公布了三个合作案例,每个都能看出不同的科研场景:Manifold Bio 利用 Claude Science 进行组织靶向药物设计。它需要评估大量候选分子在不同组织和靶点中的表达、运输和安全性。此前这类工作需要一个通用编码助手,配合人工大量收集和判断数据。Claude Science 能端到端完成这个流程:收集正确的数据,结合 Manifold 内部专有数据的上下文应用判断。关键在于"上下文"——代理不是孤立地分析,而是把过去项目的上下文纳入当前评估。Allen Institute 的 Jérôme Lecoq 构建了一个多代理"计算评审模板",包含约 20 个自定义技能。子代理阅读数千篇论文,提取核心主张和关键定量发现,存入一个证据状态数据库;随后 pipeline 构建叙事结构,逐节撰写评审,并委派给各自的专责子代理。这个案例最有技术参考价值的是"actor-critic pairs"设计:一个代理负责生成内容,另一个独立的评审代理负责评估准确性和引用保真度。Lecoq 团队过去写这样的综述可能需要两年,现在已有约 10 篇综述,其中多篇超过 100 页。UCSF 的 Stephen Francis 实验室研究胶质瘤分子流行病学,重点关注大量小效应生殖系变异如何结合起来影响个体易感性。Francis 表示,Claude Science 将多种方法综合的生殖系分析速度提升了约 10 倍,且该小组独立验证了结果。这些案例的共同点不是"AI 替换科学家",而是"AI 接管流程中的调度、检索、计算和审校环节,科学家保留判断和决策权"。什么还不确定官方没有披露 Claude Science 的底层模型版本,也没有公开任何 Benchmark 数据。宣传中提到的"速度提升约 10 倍"来自合作实验室自我报告,不是标准测试。对科研团队来说,复现验证仍然是不可跳过的一环。从工程角度看,Claude Science 更像一个可扩展的 Agent 平台:它用 skills 和 connectors 连接外部工具,用会话上下文管理长流程,用 reviewer agent 做输出校验,用人工审批控制计算资源访问。这个架构不局限于生命科学,但在生命科学这种数据源异构、流程长、容错率低的场景中,价值最明显。对中国 AI 开发者而言,真正值得借鉴的可能是它的落地策略:不试图替代实验室已有工具,而是通过技能、连接器和可复用 pipeline 融入现有基础设施。AI 工作台的竞争,或许将从模型参数转向生态连接能力和可审计性。
Anthropic 推出 Claude Science:面向科学家的可审计 AI 工作台
原创
1小时前
1
#Claude Science
#AI工作台
#科研工具
#Anthropic
#可审计产物
评论 0
暂无评论,来说两句吧
精选推荐
1
并行Sub-Agent为什么让Token成本暴涨?并发、上下文复制与预算排查
1178
2
手搓生产级 AI Agent 系统(9):Checkpoint、Human-in-the-Loop与断点恢复
1175
3
Supervisor、Handoff与Blackboard怎么选?多Agent协作模式指南
1102
4
多Agent协作时为什么总是传递旧上下文?状态版本与消息边界排查
1086
5
手搓生产级 AI Agent 系统(11):代码与浏览器沙箱、安全执行与风险控制
1074
6
手搓生产级 AI Agent 系统(10):多Agent协作、Supervisor与共享状态
1071
7
Browser Agent遇到验证码和登录循环怎么办?会话、人工接管与站点策略排查
1065
8
Code Interpreter临时文件为什么泄露到其他任务?工作目录与生命周期排查
1062
9
用Spring Boot实现预算感知的多Agent编排器
1018
10
用Spring Boot搭建Agent安全执行网关:代码沙箱、浏览器会话与审计
1005
11
容器沙箱、MicroVM与远程执行服务怎么选?Agent代码执行架构指南
983
12
别再拿十道题测模型了:一个能真正比较三家 API 的 200 题评测脚手架
966
13
离线Benchmark、影子流量与金丝雀评测怎么选?AI质量验证指南
914
14
用Spring Boot搭建AI发布质量门禁:离线评测、影子流量与金丝雀决策
903
15
SWE-Bench 高就一定会写项目?一篇 GH200 实测给了三个反例
889
16
AI应用评测与质量保障(1):从离线评测到线上质量门禁
887
17
LLM-as-a-Judge评分忽高忽低?位置偏差、长度偏差与校准排查
885
18
OpenAI 昨天说“防守窗口正在收窄”:真正该紧张的不是零日,而是仓库里那堆没人管的旧东西
883
19
离线评测分数很高,线上用户为什么仍然不满意?数据分布与任务成功率排查
866
20
GPT-5.6、Claude Opus 5、Gemini 3.7 Flash:我不会按总榜选模型
847