
随着Agent走向真实工作,后训练和数据正在成为提升智能的关键。
据数据供应商 Handshake 方估算,多家头部 AI 公司每年在“人类数据”上的支出已接近 10 亿美元量级。
从专家完成的 SFT、RLHF 数据,到可以运行数万次 rollout 的 RL 环境,再到 评分器(grader)、验证器(verifier)、训练 recipe、算力和整套 RL 服务,“数据公司”正在变成模型后训练的外部研发部门,长出了Surge AI、Mercor、Scale AI 这样的头部选手。
将视线转回中国数据市场,其体量也在快速增长。以字节为例,据报道,2026 年为世界模型训练数据安排的预算达到数千万元人民币, Coding 数据投入仅次于世界模型。
在这个背景下,一个值得关心的问题是,国产模型的后训练需要哪些数据,正在把哪些环节留在内部,哪些工作交给外部团队?如果模型公司需要专家任务、Agent 轨迹、Benchmark、可执行环境和自动验证信号,国内有哪些团队正在提供这些能力?
本期项目推荐,我们整理了一批新兴公司,包括智能知识、Copula Lab、原壤智能、UniPat AI、维纳智能等。这些公司都位于“后训练—评测—数据反馈”这条宽泛链条上,但商业形态不同:有的是专家数据供应商,有的是数据生产软件或 RL 环境创业公司,有的是研究型 Benchmark 团队,还有的把合成数据能力封装进企业 Agent。
以下是具体信息。
智能知识(Human Intelligence )

一句话定位:智能知识是一家“专家网络 + 数据生产软件 + RL-ready 任务数据”的组合型供应商。
产品概述
其业务可以分成三层:专家从哪里来、数据如何生产,以及最终生产什么数据。
第一层是“一面千识”,负责专家供给。和简单开放任务、让普通标注员抢单的方式不同,它是根据模型公司的训练目标确定人才画像,再通过身份和学历验证、AI 面试等流程筛选专家,最后完成任务分配、质量追踪和报酬结算。

从目前公开的招募岗位看,一面千识以程序员为主,其它岗位覆盖金融证券、内容运营、法律实务、创新药研发、K12教育、记者编辑、医生、保险、税务和高校科研人员等。
以金融岗位为例,专家需要设计真实投研任务,准备公告、财报、行情和监管规则等材料,确定估值方法、核心假设和验收标准,再审核模型结论中的数据误读、风险遗漏与证据问题,偏向于“专业工作任务生产工作流”。
官方披露,一面千识已实现每日数百场AI面试、每月数千名专家成功接单,已连接50,000+领域专家。
第二层是 Xpert Studio,负责把专家组织成一条可规模化的数据生产线。平台覆盖标注界面配置、任务分发、权限管理、抽样审核、多轮质检、标注一致性计算和质量看板,也支持通过 API、SDK、云端或私有化方式接入模型团队现有的数据流程。
第三层是它最终交付的数据。Xpert Studio 除了支持常规问答、分类和偏好排序,还面向 CoT、规划、多轮对话、API调用、Browser Use、Computer Use等复杂Agent任务,目前已发布了Terminal RL Data、MCP Data。
团队背景
智能知识核心团队来自字节跳动 Seed 部门,已经获得头部大模型公司订单,完成初步 PMF,2026年6月宣布完成由锦秋基金、耀途资本联合投资的天使轮融资,此前种子轮获得五源资本和奇绩创坛投资。本轮资金主要用于扩张Coding、Enterprise Office、Agentic Tool Use等数据品类,以及升级专家画像、技能评估和人岗匹配系统。
为什么值得关注
智能知识的业务形式,直接对标Scale AI。
一面千识对应Scale旗下的Outlier,负责招募、筛选和管理领域专家;Xpert Studio对应Scale Data Engine,由AI辅助,把任务配置、专家协作、标注审核和质量控制沉淀成软件;Terminal RL等数据资产,则开始向Scale AI 的RL Environments靠近,不仅包含题目和答案,还包含Docker环境、测试脚本、Oracle参考解法、运行轨迹和元数据;MCP任务则进一步加入受控网页、浏览器工具和程序化Verifier,可以让模型进入环境反复尝试,记录完整rollout,并通过测试结果获得明确的奖励信号。
值得注意的是,Xpert Studio还试图降低专业数据生产工具的门槛。平台目前提供三档定价:社区版面向独立开发者限量免费,会员价格为3000元/年,VIP为5万元/年,相比只服务头部实验室的大额数据合同,这套定价意味着小型Agent团队、研究机构和独立开发者也可以自己组织专家、设计评测集和迭代数据。
Copula Lab

一句话定位:Copula Lab 提供专家工作流数据、Benchmark、评测和 RL 环境,主要面向前沿模型团队。
产品概述
继编程之后,下一个前沿是模型能否真正深入高经济价值、高门槛的专业工作流。前沿后训练正在从静态问答、偏好标注和单轮任务,转向可交互、可验证、可扩展的专家工作流环境。
Copula Lab想解决的问题是:如何让模型在一个接近真实工作的环境中连续使用工具、处理多步依赖、修正错误,最终完成一份可以被专业人士验收的交付物。

目前官网公开的数据产品主要集中在 Coding、设计和专业办公任务。例如,WebDev 将自然语言需求、可运行的前端产品、开发轨迹、页面截图和专家审美评分组合成数据,可用于 SFT、偏好训练、RL 和评测。
团队背景
创始人梁丽曾负责 MiniMax 的 Agent 业务,并从零建立内部 Agent Benchmark。
技术联合创始人蔡佳人曾担任 MiniMax 开源负责人和后训练工程师,参与 MiniMax M2 系列在 Coding 方向的后训练,并负责与 LMArena、Vals AI、Terminal-Bench 等 Benchmark 和数据项目的合作。目前公司尚未公开披露融资情况。
为什么值得关注
如果说智能知识更像“专家众包网络+数据生产平台”,GOMAX 更偏向中文科学与产业数据及垂类评测,那么 Copula Lab 的特点,是从模型公司内部的后训练需求出发,反向设计数据和环境。
创始团队既做过 Agent 产品,也参与过模型后训练和 Benchmark 建设,因此它的出发点不是召集专家网络,而是模型在真实任务中为什么失败,从不同的 failure mode,形成不同的任务、轨迹、Rubric、环境和奖励信号,这使 Copula 的数据更接近模型训练团队实际采购的形态。
在本期几家公司中,Copula 是将 RL Environment 明确放在核心产品位置的一家。但目前公开案例主要证明它能够生产“任务+运行资产+轨迹+评分标准”,还不能证明这些环境已经具备大规模 RL 训练所要求的完整工程能力。
真正值得继续验证的是:环境能否被稳定重置和复现,能否直接连接模型公司的 Agent 与训练框架,能否支持大量并行 rollout;评分函数是否足够自动化、稳定且不容易被模型钻空子;以及这些任务经过训练后,能否在独立 Benchmark 上带来可复现的能力提升。
UniPat AI

一句话定位:UniPat AI 是一家围绕真实世界能力构建 Benchmark、训练数据和实验模型的 research-first 团队。
产品概述
它不是传统意义上的数据公司,也暂时不像 Copula Lab 那样明确向模型公司销售专家工作流数据和 RL 环境。UniPat 更像一座数据与后训练实验室:先构造足够真实、足够困难的任务,找到模型的能力缺口;再围绕这些缺口生产数据、设计 Rubric,并通过实际后训练验证这些训练信号是否有效。
在 Agent 评测方面,UniPat 已发布 SaaS-Bench、RoadmapBench、EvoCode-Bench、Monthly-SWEBench、BabyVision 等多个 Benchmark,覆盖 Computer Use、长期软件开发、多轮 Coding 和视觉推理。
除了 Benchmark,UniPat 也在生产后训练数据并亲自训练模型。
其 UniScientist 项目通过人类专家与 LLM 协作,生产了超过 4,700 个研究级科学任务,覆盖 50 多个学科,并为每个任务配套可验证的 Rubric。团队随后用这些数据对 Qwen3-30B-A3B-Thinking 进行 Agentic SFT,显著提升了效果。
团队背景
UniPat 公开研究的主要贡献者包括 Liang Chen、Kuan Li 等人,公开资料未披露其融资情况,也没有明确说明 Benchmark、数据和 RL 环境的商业化收入。
为什么值得关注
UniPat 值得关注的地方,是它没有把 Benchmark、数据和后训练当成三件分离的事。
很多数据公司完成交付后,很难回答一个问题:这批数据到底有没有让模型变强?UniPat 的做法是先用真实任务找到模型的 failure mode,再围绕这些失败生产训练数据和评分标准,最后实际训练模型,并在留出集和外部 Benchmark 上验证能力有没有提升。
从 UniScientist、ExpertEval 到 BabyVision,其公开项目已经覆盖了三种不同的数据路线:LLM 大规模合成、专家直接生产,以及面向 RLVR 的可验证数据。它也分别用 Agentic SFT、Rubric rejection sampling 和 GRPO 做过后训练实验。相比单纯发布排行榜,这更接近一套“发现能力缺口—生产训练信号—训练模型—验证泛化”的数据研究闭环。
下一步需要观察的是,它会继续作为研究团队发布模型和 Benchmark,还是把这些能力封装成面向模型公司的环境、数据或后训练服务。
原壤智能
一句话定位:原壤智能目前通过两个品牌开展业务:负责专家招募和任务交付的 TalentsAI,以及负责高质量数据、Benchmark 和企业数据合作的 Humanlaya。
产品概述
TalentsAI 是原壤智能的专家数据生产平台。它负责寻找不同学科的专业人员,验证学历、执业资格和工作经历,再将专家匹配给模型训练与评测项目。
据平台披露,TalentsAI 目前已有超过5万名专家入驻,覆盖300多个细分学科,其中包括5000多名博士级人才,并与10多家头部 AI Lab 合作。平台公开的任务类型包括复杂指令遵循、Rubric 设计与评测、HLE 高难度推理、RLHF、VLM、长文本与专业文档处理,以及金融、法律、医疗、自然科学、软件工程等领域的多轮对话和学科验证。