2026 年上半年,成立仅三年的 Mercor 实现了 6.14 亿美元总收入,其中 91% 来自基础模型公司。公司将约三分之二的收入支付给承包商,第二季度毛利率为 33%。
据《The Information》获得的融资材料,Mercor 向潜在投资者预测,到 2030 年,公司总收入将接近 690 亿美元,毛利率达到 56%,《财富》2000 强企业贡献 57% 的收入,基础模型公司的占比则降至三分之一以下。
Mercor 还在洽谈新一轮融资,讨论中的估值约为 200 亿美元。英伟达既是其重要客户,也考虑过参与投资。截至 9 月 10 日,这轮融资尚未获得完成确认。公司最近一次正式公布的估值,是 2025 年 10 月融资时的 100 亿美元。
支撑 Mercor 收入的,是一套规模庞大的专家数据生产体系。Mercor 为 OpenAI、Anthropic、Google DeepMind 等模型公司寻找律师、医生、程序员和金融从业者,组织他们制作训练数据、专业任务和评分标准。
而随着今天模型能力彼此越来越趋近,更多的竞争都取决于后训练的数据质量,OpenAI和Anthropic的大量工作都围绕获取更高质量数据展开。数据成了模型竞赛的关键,能不能从Mercor这样的公司获得独家的对训练有直接成效的数据,就几乎直接决定了每一轮模型比拼的结果。Mercor们某种程度上开始卡OpenAI和Anthropic们的脖子,它们水涨船高的估值和收入就是最直接证明。
支撑未来增长预测的,则是评测、强化学习环境和企业 AI 服务。Mercor 已经进入这些领域,这家从招聘起家的公司,正在试图改变自己的收入结构。

(在即将于旧金山举办的Assembling 2026大会上,我们也将请到Mercor的核心团队,和我们进行对话,聊一聊这家公司最新的情况和他们的思考)

报名链接:https://luma.com/848c857m
三个大学生,借 Scale 进入 AI 数据市场
Mercor 的三位创始人 Brendan Foody、Adarsh Hiremath 和 Surya Midha 相识于旧金山湾区的 Bellarmine 中学,都是辩论队成员。Hiremath 和 Midha 曾作为搭档赢得三项全国政策辩论赛事冠军。
后来,Foody 和 Midha 进入乔治城大学,Hiremath 就读哈佛。2023 年,三人在巴西圣保罗参加黑客马拉松时,发现了一门相当简单的生意:将印度工程师介绍给需要开发人员的美国初创企业,负责招聘、合同和支付,再收取服务费。

Mercor CTO Adarsh Hiremath 与 CEO Brendan Foody
第一位客户每周支付 500 美元,Mercor 将其中约 70% 付给工程师,留下其余部分。创业很快占据了三人的全部时间。Foody 没有参加大学期末考试,他们随后相继离校,并在 2024 年成为 Thiel Fellows。
Mercor 最初的产品是一套 AI 招聘系统。它能读取候选人的简历、GitHub 和作品集,进行视频面试、评估技能、匹配岗位,并处理后续合同与报酬。
2024 年 1 月,公司宣布获得 General Catalyst 领投的 360 万美元种子轮融资。同年 9 月,Benchmark 领投 A 轮,估值达到 2.5 亿美元。2025 年 2 月,Mercor 又以 20 亿美元估值融资 1 亿美元。
改变业务方向的重要契机,来自数据公司 Scale AI。
根据 Mercor 投资方 Felicis 对创始人的采访,Mercor 曾通过 Scale 为前沿模型公司招募一千多名工程师。随后,部分承包商抱怨付款和平台管理问题,Mercor 开始绕过中间商,直接服务模型公司,并获得 Cognition 等客户的订单。
原先,美国创业企业雇用工程师,是为了开发自己的产品。模型公司则需要工程师设计编程任务、提供参考答案、评价模型生成的代码,或者制作可以让 Agent 排查的故障。
Mercor 原有的招聘系统,恰好能够处理这种快速变化的人才需求。它随后将专家网络扩展到法律、医学、金融、科研等领域。
人才平台也在进入 AI 数据市场。Handshake 利用校园和职业网络寻找专家,Turing 则将全球软件工程师资源用于模型训练。原有的招聘、技能筛选和人才管理体系,让这些公司能够相对迅速地进入专家数据业务。
一份训练数据,到底怎么生产?
Mercor 曾在官网发布一份“简体中文双语法律专家”招聘启事。

岗位要求申请人拥有法学高等学位、普通话母语水平,以及在中国执业至少两年的经验。工作完全远程,时薪 70 至 80 美元,每周至少投入 20 小时,项目预计持续两个月。
候选人需要提交简历,完成两轮 AI 面试,再接受付费试工。正式进入项目后,工作包括翻译、改写和整理中国法律内容,检查术语与法律制度的准确性。
招聘只是数据生产的第一步。模型学习编写代码,可以借助单元测试检查程序是否正确。一份法律分析的整体质量,却很难仅靠程序充分衡量。有没有引用正确条款、是否遗漏关键风险、结论能否得到证据支持,都需要专业人士制定评价标准。
行业将这类评分标准称为 rubric。专家把“什么是好答案”拆成可以逐项检查的要求,再据此评价模型的回答。
模型公司还可以根据模型的薄弱环节提出需求。例如,发现模型在某类合同分析中反复犯错,就让专家针对这些问题制作新的任务和评价标准,用于评测或后续训练。

Mercor 部分项目使用 RL Studio 组织任务生产,参与者分为 Writer 和 Reviewer。前者创建任务、编辑内容并提交审核,后者负责批准、退回修改或提供反馈。一个任务通常包含提示词、可选输入文件和评分标准,状态可以在 Pending、In Review、Approved、Needs Edits、Discarded 之间流转。
任务的评分可以由专家完成,也可以由 AI 根据专家制定的 rubric 自动执行。Mercor 曾向 TIME 表示,在 APEX 评测中,AI 评分与人工评审的一致率达到 89%。
部分按小时计酬的项目还会使用 Insightful 记录工时。软件可以定期截取屏幕截图,辅助核验工作记录;按照 Mercor 的公开政策,扣除工时前需要由人工结合截图和具体情境审核。平台也存在按交付物结算的项目,具体规则取决于合同。
这些系统将专家工作拆成可以分配、审核和结算的任务。Mercor 在 2026 年 5 月披露,平台每周向承包商支付的金额已超过 1400 万美元,周活跃承包商超过三万人。它宣称拥有近五百万人的专家网络,但这一规模不能直接理解为实际在岗或被平台独占的专家人数。
专家生产的数据也已经远远超出问答形式。2026 年 3 月,Mercor 与 AI 编程公司 Cognition 合作推出 APEX-SWE。为了制作一道故障排查任务,工程师需要编写 500 至 1000 行正常运行日志,再混入 10 至 20 行故障症状,配置聊天记录、监控系统、容器环境和参考修复方案。
任务改编自真实 GitHub 项目中的问题与代码修复记录。Agent 要进入环境,寻找线索、定位故障并修复系统,最后由测试或评分规则判断是否完成。
一份数据由此可能包含题目、文件、软件、参考答案和验证程序。它既可以用来评测模型,也可以在适当处理后成为强化学习材料。
这门生意的工作跨度很大。2025 年 11 月,一个代号为 Musen、涉及 Meta 短视频内容的项目突然结束。《福布斯》采访的承包商称,该项目的 Slack 工作群一度超过 5000 人,部分人员原本获得每小时 21 美元,随后收到另一个项目 Nova 的邀请,时薪降至 16 美元。
Mercor 发言人认为相关报道不准确。Foody 后来表示,公司已经在招聘和入职材料中说明原项目具有临时性质。
部分项目还使用代号,不向承包商正式公布最终客户。这既可以帮助模型公司隔离项目和保护研发信息,也使工作者的合同、考核和收入主要取决于 Mercor 的管理。
模型公司可以要求供应商短期增加数千名人员,也可以在需求变化时终止项目。对客户有价值的弹性,同时构成 Mercor 的运营压力和承包商的收入风险。
模型公司为什么愿意外包?
Mercor 的增长,与模型训练需求的变化直接相关。
预训练主要利用网页、书籍和代码等大规模内容。此后的监督微调、人类反馈和强化学习,需要更多示范答案、质量判断与训练反馈。
随着 AI 开始编程、分析合同、制作财务模型和操作企业软件,模型公司还需要获取真实工作的背景、过程和验收标准。
一份公开的并购协议,很难完整呈现投行分析师如何查阅材料、处理财务异常、修改模型并制作最终报告。律师、医生等专业人士长期积累的判断,也未必存在现成、合法可用的公开数据。
模型公司既在建设自己的数据团队,也会向外部供应商采购。核心训练目标、关键评测、数据标准和模型迭代,通常需要模型公司的研究团队深度参与。外部供应商则可以承担专家招聘、资质验证、任务生产、质量管理和项目运营,双方分工随项目而变化。
Mercor 自己也承认,数据已经成为模型公司的核心知识产权。出于模型能力和数据安全考虑,内部建设数据生产流程有充分理由。
它在 Black Box vs. Open Box 文档中提出,允许客户保留数据控制权,使用自己的平台,甚至直接与专家合作,同时将招聘、筛选和人员管理交给 Mercor。客户可以掌握核心研究流程,又不必独自承担所有用工事务。
外包的价值主要体现在需求波动和组织效率。一个模型项目可能突然需要数百名化学专家,几个月后又转向金融或软件工程。如果全部长期雇用,模型公司需要承担固定成本;如果逐个聘请短期人员,又要处理资历、合同、培训、质检和付款。
Mercor 将这些工作集中处理,再把人才渠道和项目管理系统用于不同客户。即便模型公司自建数据团队,需求也不一定稳定。2025 年 9 月,xAI 据报道裁减至少 500 名通用数据工作人员,同时宣布大幅扩充专业领域 AI tutor。内部团队同样需要随着训练重点调整。
2025 年 6 月,Meta 投资 Scale AI 又改变了模型公司的采购选择。
Meta 以约 143 亿美元取得 Scale 49% 的股份,Scale 创始人 Alexandr Wang 随后加入 Meta。Google 等模型公司重新评估与 Scale 的合作。数据供应商可能接触模型缺陷、训练任务和研发方向,其独立性因此成为采购时需要考虑的因素。
Mercor、Surge、Handshake 等公司获得了新的争取订单的机会。不过 Mercor 在这笔交易前就已经进入高速增长阶段,Scale 事件只是加速因素之一。
这些公司的业务已经明显重叠,差异仍然存在。Scale 拥有长期积累的数据生产体系、全球交付能力和 Outlier 专家网络;Surge 更早深入语言数据、RLHF 和研究协作;Handshake 依靠校园与职业网络获取专家;Turing 则拥有软件工程师供给和模型训练经验。
Mercor 从自动招聘切入,逐渐建立专家表现记录、任务生产流程和研究团队。相比单纯介绍人才,它希望更深地参与客户对数据质量和模型效果的判断。但专家可以同时为不同平台工作,庞大的人才名单并不代表独占供给。
模型公司也没有理由只选择一家供应商。
英伟达就是一个例子。据 2026 年 8 月披露的信息,它此前一个季度向 Mercor 支付了数千万美元,相关数据用于 Nemotron 模型,部分 Mercor 员工几乎全职服务英伟达。
与此同时,英伟达仍向 Turing、Scale 采购,也拥有内部数据团队,并大量使用合成数据。它还讨论过参投 Mercor,目前尚未确认完成。
供应商之间的竞争,最终要落实到交付能力。谁能更快找到合适的人,谁的任务质量更可靠,谁能更快响应研究反馈,以及谁的数据真正改善了模型表现。
模型公司可以持续增加外部采购,也可以分散预算、收回部分工作。Mercor 要获得更长期的收入,必须让客户有理由持续购买。
Mercor 想提高每小时专家劳动的价值
Mercor 官网如今列出了人才招聘、定制数据、现成数据集、专业评测、强化学习环境、企业 AI 和数据授权等业务。
这些产品处在不同的成熟阶段。
财务材料能够确认,基础模型公司贡献了 Mercor 绝大部分收入。公司并未公布各产品的收入拆分,现成数据集、评测、环境和企业业务正在扩张,其独立收入与毛利数据仍然缺失。
第一步是让数据可以重复销售。定制项目需要根据客户要求重新组织生产。现成数据集则可以提前制作,在授权条件允许的情况下卖给不同客户。Mercor 宣称其数据目录拥有超过五万条任务,覆盖三十多个领域。
如果同一批任务能够多次授权,新增收入就不必承担完全相同的生产成本。但数据复用还受合同、任务有效期和客户需求限制。Mercor 没有公布现成数据集的实际收入,也没有披露复用率。
第二步是评测。2025 年,Mercor 推出 APEX,使用法律、医学、金融和咨询等专业任务衡量模型的工作能力。2026 年 1 月,APEX-Agents 进一步引入长程、跨应用任务,让 Agent 在虚构企业的文档、表格、邮件和聊天记录中寻找信息,完成专业工作。
评测可以帮助模型公司发现缺陷,也能指导下一轮任务生产和后训练。专家制定的 rubric,因此开始同时服务数据生产、能力测量和训练反馈。
评测系统也需要持续维护。9 月 8 日,Mercor 更新 APEX-Agents 1.1。此前,研究团队发现一些模型会同时给出多个备选答案,以提高命中评分条目的概率。新版本加强任务审核,修改评分方式,避免奖励这种行为。
评测业务的价值不仅在于生产更多题目,还在于题目和评分机制能够跟上模型能力的变化。
第三步是强化学习环境。让 Agent 学会操作企业软件,光有任务和参考答案还不够。模型需要进入可以实际运行的工作场景,在其中不断尝试,并根据结果接受反馈。
完整环境通常包含三个部分。World 提供虚构企业的人员、文件、邮件和业务背景;Apps 提供可以操作的软件;Tasks 则规定具体目标和 verifier,也就是检查 Agent 是否完成工作的验证器。
环境还需要能够重置、并行运行和记录操作过程。模型才能反复练习,使用这些反馈继续训练。
2026 年 2 月,Mercor 收购 Sepal AI。后者已经从事高质量训练数据、评测和强化学习环境业务。3 月发布的 APEX-SWE,也展示了 Mercor 组织专家制作复杂软件工程环境的能力。

7 月,Mercor 又宣布收购 Deeptune。Deeptune 已经重建数百种企业应用,能够让 Agent 在模拟软件中执行任务。公司此前获得 Andreessen Horowitz 领投的 4300 万美元 A 轮融资,Foody 曾以个人身份参投。Mercor 在收购前也是 Deeptune 的客户。
这笔收购的意义,在于将更系统的应用仿真平台并入 Mercor。此前,公司已经拥有专家、任务、评分和部分环境工程能力,Deeptune 则补强了软件层,使其有机会将专家工作和可运行的训练环境一起交付。
模型公司可以分别采购专家、数据、软件环境和训练系统,也可以尝试向一家供应商购买更完整的服务。Mercor 正在争取后者的订单。这笔交易的价格没有披露。
第四步是参与后训练。2026 年初,Mercor 为 Applied Compute 提供专业任务和评测,由后者使用专有强化学习系统,对 GLM-4.6 和 GLM-4.7 进行后训练。
9 月,Mercor 又与 SkyRL 合作,使用 1928 个专家制作的任务,对 Qwen3.5-397B-A17B 进行强化学习。公司公布的结果显示,模型在当时版本的 APEX-Agents 上,单次任务成功率从 16.11% 提高到 27.29%。双方还公开了训练脚本、模型权重和评测记录。这说明 Mercor 已经能够参与大型开放模型的后训练研发。
企业究竟向 Mercor 买什么?
Mercor 在 2026 年 3 月推出 Enterprise AI,希望把为模型公司建立的专家、评测和训练能力用于企业自身的工作流程。

融资材料中的新增客户,需要分成两类。
一类是 AI 初创公司,包括开发 AI 应用、自建模型或微调现有模型的企业。它们需要采购的仍可能是专家、定制数据、评测和训练服务,与基础模型公司的需求存在重叠。
Mercor 预计,到 2028 年,这类 AI 初创公司与《财富》2000 强企业贡献的收入合计将超过基础模型公司。这个预测并不是说传统企业届时将单独反超模型公司。
另一类是使用 AI 改造自身业务的传统企业。Mercor 的 Enterprise AI 已经提供了几种具体服务。
首先是工作流诊断。它通过员工访谈、企业数据和业务流程分析,找出适合引入 AI 的环节,并交付按优先级排列的机会清单、实施路线和收益估算。
其次是评测。企业可以根据自身要求检查模型和 Agent,确定哪种方案符合业务标准、哪里容易失败,以及是否达到部署条件。
再往后是部署与优化。Mercor 提供前线部署工程师,将 Agent 接入企业现有系统,检查代码、提示词、工具和模型选择,并根据实际运行结果持续