从 Scale AI到 Surge AI,再到异军突起的 Mercor,在北美,一批AI Data公司的价值已经被验证。


它们做的事情,不只是传统意义上的数据标注,是把专家、真实任务、模型评测、RLHF、Agent 环境,甚至企业真实工作流程,组织成可以持续产生训练信号的基础设施。


Alex Wang把Scale AI的数据引擎,定义为「收集、整理和标注数据,再训练和评估模型」的完整闭环;


Mercor则进一步把专家网络、数据集、Benchmark 和 RL Environment 放到了一起。


当模型越来越强之后,真正稀缺的可能不再是更多数据,而是更接近真实世界、更难获得、能够产生有效反馈的数据。


随着AI从屏幕里的语言模型走向Agent、走进机器人和具身智能,物理世界和数字世界的边界被打破,关于数据新的范式和可能性也在延伸。


用数据智能Data Loop,开启AI下半场——专访本原智数CTO林震亚


在国内,同样有着来自AI数据领域的公司,做出了非常前沿的探索。


本原智数,就是一家深耕AI数据行业十年的公司,也是港股千百度(01028.HK)旗下全赛道专业数据服务商。


他们提供以数据为核心的AI一站式解决方案,包括采标审一体化、高质量数据集建设、智能体搭建、模型部署、微调等。


用数据智能Data Loop,开启AI下半场——专访本原智数CTO林震亚


「高质量数据稀缺时代,人机协同的智能数据标注正改写AI能力边界。」


今天,特别邀请了本原智数的CTO林震亚,听听他怎么说。


用数据智能Data Loop,开启AI下半场——专访本原智数CTO林震亚


Q1:


林总您好,您的履历非常特别——从大模型厂商的研发负责人到数据服务公司的 CTO,很多人说这是一个“逆行”的选择,为什么?


林震亚:


我加入本原智数,这个选择看起来像是“逆行”,但其实它是我一直以来沿着产业应用方向探索的结果。


我在中兴通讯研究院工作时发现一个有意思的现象:过去学术界优化模型,常用控制变量法——在数据集固定时,通过不断优化embedding层、模型结构、目标函数、优化器、训练策略等来提升模型表现,每次提升通常有限,能在sota上提升一个以上百分点的已经属于优秀成果了。


但从产业应用的角度来看,我们完全可以换一个思路。与其只在模型层面优化,不如回到数据本身。通过分析模型的 counter case、bad case,找到模型能力不足的地方,然后从数据层面进行补足,往往能够带来更明显的效果。


我逐渐意识到,纯粹做模型研究并非产业最大价值所在,更应关注前沿AI技术在产业中能发挥多少价值。


基于此,我选择更靠近应用的方向。作为NLP算法负责人,选择金融行业,是因为它既有资源支持顶尖算法人才,又有大量高质量文本数据和相对成熟的数据管理体系。


大模型时代的到来让我进一步确认了这个方向。过去训练一个模型,需要花大量时间设计模型结构、准备数据。但大模型出现以后,技术范式发生了变化,通过 few shot learning(少样本学习)范式,依托后训练或是提示工程,用较少的数据也可以在垂直领域取得不错的效果。


于是我也希望看看,在新的AI范式下,传统行业能不能通过智能化赋能发生改变。


之后我以首席架构师的身份加入了春秋航空,牵头负责五十多个AI项目。在这个过程中,我们看到大模型给传统行业带来了很多新的可能。过去很多问题需要大量人工和结构化数据才能解决,但现在大模型能够更好地利用企业内部大量非结构化数据,比如文档、知识资料等,帮助企业提升效率。


同时,我也发现一个更深层的问题——大模型应用的“最后一公里”,依然是数据,数据质量和使用方式直接影响模型输出表现。


现在模型的能力越来越强,大部分场景不需要再做训练微调,真正决定企业AI应用效果的,是企业如何构建自己的数据体系和 Harness。


哪些数据适合进入知识库,哪些数据适合作为长记忆,哪些数据适合作为短记忆,不同数据如何在业务流程中被模型有效调用,这些都依赖业务理解和垂域数据能力。


此外,AI应用最终能不能落地,也需要评测体系来验证。评测集决定了业务场景的AI应用落地标准,定义了模型效果差异,评测集是另一种形式的高质量数据。


如今我选择加入本原智数,希望把过去在模型研发、数据工程和产业实践中的经验用于服务更多行业,推动千行百业的AI落地。


从某种意义上来说,这并不是一次“逆行”,而是回到了AI产业非常关键的一环。


Q2:


您觉得AI行业当前最大的瓶颈是什么?


林震亚:


当前AI行业最大的瓶颈我认为是高质量数据集供给不足。


过去几年大模型的快速发展,很大程度上依赖互联网公开数据的规模化利用。但随着模型规模扩大,容易获取的通用数据正在快速减少,数据红利逐渐消退。


更重要的是,公开数据本身存在局限:一方面,很多数据质量参差、重复度高、有效信息密度不足;另一方面,通用数据能覆盖的场景越来越有限,企业真正需要的是面向专业领域、复杂任务和真实业务场景的高价值数据。


所以现在AI行业面临一个非常明显的矛盾:一边是模型表现不断提升,应用需求不断扩大;另一边是能够支撑模型能力进一步提升以及在垂域场景落地应用的数据供给速度,远远跟不上需求的发展。


模型和算力当然仍然重要,但已不是最大制约因素。更好的模型可以降低训练和推理成本,让 scaling 曲线变得更加平稳、提高斜率;更丰富的算力可以支撑更多训练实验,同时更好的保障token供给。


但如果缺少高质量数据支撑,模型能力提升最终会遇到瓶颈,特别是在高价值垂域场景,很难将模型能力转化为应用价值。


Q3:


那您认为破局的关键是什么?


林震亚:


未来AI竞争的核心,一定是数据飞轮的竞争。


我们过去讲数据生产,更多关注的是数据采集和简单标注。但随着大模型、智能体的发展,数据生产本身正在发生变化。


未来真正有价值的数据,不只是“标出来”,而是需要围绕模型能力提升和业务场景需求,对数据进行深度加工、评估和优化。


针对垂域场景,GDPval、ALE等评测集已经做的很不错了,这些bench可以客观评价大模型在垂域任务上的表现。现在因为相关数据成本还不高,所以数据公司有很高的leverage。


但是随着成本上升,能驱动这件事的会越来越多变成做平台或垂类业务的公司。在未来,最好的RL环境就是每一家垂域公司的核心资产,而不再是只让agents做post train的众多环境的一个。


这件事已经在发生,之前在春航提出一个概念叫无感标注,本质上是将AI应用嵌入到业务流程中,通过业务人员的审核、优化等反馈动作获取数据,再将数据用于模型表现的提升。


在这个背景下,本原正在聚焦做两件事,一是bench顶尖研发者生态建设,二是安全可靠的token工厂。


为什么要建这个生态,因为每家企业都想建数据飞轮,但是数据飞轮能转起来的根基是有好的AI落地评价标准,大部分企业都没有具备发表大模型评测方向顶会的人才。


有了这个生态,可以给研究者提供场景、提供数据甚至算力,加快高质量bench论文发表;对于企业来说,顶尖研究者的参与可以构建更高质量的RL environment,加速数据飞轮的构建。


为了支撑这个生态,本原智数构建了原识标注 Harness、原测评测 Bench、原智智能体 Flow、原物具身 Physis 四大平台,打通模型评测、数据生产、数据应用全链路,覆盖大模型、世界模型、physical AI、智能体等多类场景。


用数据智能Data Loop,开启AI下半场——专访本原智数CTO林震亚


建token工厂的逻辑更简单,当前大部分token工厂并不是安全可靠的,少量安全可靠的token工厂不具备将数据飞轮转起来的能力。AI应用范围越广,token工厂的价值越高,提供token的逻辑就不讲了,重点是集成效应和飞轮效应。


集成效应容易理解,做过模型的都知道,ensemble是最简单有效的模型效果提升方法,从机器学习时代的bagging、boosting、stacking,再到deep learning时代的weight averaging。


大模型时代更简单,OpenRouter Fusion API做了一件事,把同一条 prompt 并行丢给多个模型 → judge 抽共识/矛盾/盲点 → synthesizer 出最终答案,效果惊人的好,DRACO 深研基准上:Fable 5+GPT-5.5 fusion ≈ 69.0%,Fable 5 单体 65.3%,半价预算面板 64.7%;Opus 4.8 自 fusion(问两遍)从 58.8%→65.5%。


DeepMind 研究员 Andrew Trask提出了一个概念叫“九头蛇效应”: 前沿厂商每发一个新头,路由网络就把它吸进去变强,单体永远追不上集成;为什么token工厂能构建飞轮效应,源自于一个大家都清楚的逻辑,高质量数据可以结合harness提升模型表现。


能将飞轮转起来的公司有两个特点,一是具备大量高质量数据,二是具备轨迹数据清洗、加工、标注能力,数据公司天然具备优势。


当然,token工厂安全可靠也是做这件事的前提,需通过私有化算力集群和官方账号直连提供token,配套完善的安全保障措施。否则没有高质量用户用我们的token工厂,自然数据飞轮也转不起来。


Q4:


在您看来,大模型能力要进一步提升,需要在哪些方向攻坚?


林震亚:


第一个方向,是提升大模型的“智力表现”。


大模型的“智力”本质是三层能力叠加:预训练的知识密度、推理时的隐式搜索能力、后训练的行为策略。


当前模型在简单问答、翻译、摘要上已够用,但在多步推理、精确计算、长程规划等高价值场景中,智力瓶颈明显——幻觉频发、逻辑断裂、无法自我修正。


虽然coding数据、long horizon垂域任务数据能一定程度提升模型智力表现,但针对智力本身的研究意义仍然很大,我们需要找到模型智力缺陷的最小子单元。目前,胜寒高智商俱乐部会长在我们公司,在他的支持下,对模型智力的研究不断有新进展。


第二个方向,我认为是 Coding 能力。


Coding之所以重要,是因为它已是AI领域中被验证具备商业化闭环能力的方向,且国内外模型能力与顶尖架构师仍有明显差距。


只要这个差距存在,Coding的数据需求就会持续。未来AI若在代码领域超越顶尖人类专家,影响将非常大。因为Coding本身具备递归自迭代潜力,AI可帮助优化自身软件系统,包括模型结构设计、硬件适配、训练效率提升以及推理加速等。


基于此,本原智数获得了CMMI3级认证,我们不仅是数据公司,也是专业软件公司,一方面,我们会保障内部系统平台的可靠性、稳定性;另一方面,专业的软件研发体系为我们交付大规模复杂coding项目数据提供保障。


第三个方向,是 long horizon 复杂任务能力。


未来AI不能只完成单点任务,需要具备从任务理解、过程规划、执行反馈到结果优化的完整能力。尤其在垂直行业中,我们需要把专家从接收任务到解决问题的全过程串联起来,形成复杂任务闭环。


如果AI能在各领域持续攻坚,就能成为垂域专家的智能助手,提升工作效率并沉淀业务经验。这也是AI推动产业应用的重要方向。


为掌握long horizon任务设计框架,我一方面作为信通院专家参与高质量数据集项目评审,理解垂域业务;另一方面安排公司资深研究员进入伯克利的ALE(agents' last exam)课题组参与前沿研究。


社区建成后也将支持垂域long horizon评测集构建及高质量数据生产。当然,作为头部数商,我们有海量专家资源,这也是我们能做好这件事的基石。


最后一个方向,是多模态理解和真实世界交互能力。


目前的大模型已经可以解决复杂的知识类问题,但对于真实世界中的空间关系、物理规律和环境变化,理解能力仍然有限。


未来AI需要进一步融合视觉、听觉、触觉等多模态信息,建立对真实世界更深层次的感知和交互能力。这不仅是大模型需补足的短板,也是具身智能的核心。


本原智数在具身领域已有布局,一方面依托专业交付能力和平台能力承接了大量项目,另一方面在做数据配比和模型调优实验,寻找更好的数据采集、清洗、加工、标注、应用pipeline。


用数据智能Data Loop,开启AI下半场——专访本原智数CTO林震亚


Q5:


您在很多场合强调“人机协同”,这和传统的数据标注有什么不同?


林震亚:


本质上是更好的依托我们的基础设施形成数据飞轮,不管是在数据公司内部还是面向垂域企业的服务。


需要注意的是,面向业务专家的模型/智能体跟直接面向业务问题的模型/智能体有差异,有些模型即使效果很好,专家校验、修改结果的成本仍会很高,甚至跟重新做成本接近。


因此,需要想明白如何真正意义上提升专家效率,以及在单位时间内如何获得更有效的专家反馈。


Q6:


从技术角度看,本原的评测平台有什么特点?


林震亚:


从技术角度来看,本原智数评测平台的核心特点主要体现在两个方面。


第一,我们希望充分利用积累的数据资产,建立能够对模型进行系统性评估的统一入口。


目前行业中已经有很多优秀的 Benchmark 和评测工具,但整体来看,模型评测仍然比较分散。不同团队、不同机构会针对不同能力维度设计自己的评测集,但缺少一个能够系统整合这些能力、帮助用户全面了解模型表现的平台。


因此,我们希望通过平台化的方式,把行业内高质量的公开评测集与我们自身积累的数据资源进行整合。我们会根据不同模型能力需求,对评测数据进行分类分级,形成针对不同场景的专业评测体系,让模型评测不只是一个单点成绩,而是一份更加全面的体检报告。


第二,我们希望通过建设评测社区,汇聚顶尖 Benchmark 研究者和产业专家,共同推动评测体系的发展。


评测社区也是评测平台的一部分,关于社区建设,前面已有所提及。现在学术界和产业界之间仍存在一定gap:学术界关注模型能力突破,产业界更关注模型在真实业务中的表现。


我们希望通过评测社区把这两端连接起来,让科研成果更快进入产业应用,并持续为Benchmark研究者提供场景、数据、算力及工具支持,共同推动评测标准发展。


用数据智能Data Loop,开启AI下半场——专访本原智数CTO林震亚


Q7: 


您认为中美在AI数据服务领域最大的差异是什么


林震亚:


我认为中美在AI数据服务领域最大的差异,本质上来自两个方面:一个是产业环境和劳动力结构的差异,另一个是数据获取和应用体系的差异。


先看数据生产模式。