
推荐语
过去一年,AI数据市场经历了几轮剧烈的主题切换:从标准Coding到垂直行业,从合成蒸馏到真实场景,从任务够长就是好数据到什么任务值得解。需求每两个月刷新一次,供给侧的生存法则也在同步重写。在这个过程中,一些原本隐身于产业链深处的角色开始浮出水面——数商,就是其中之一。
王泉是这个群体里一个非典型的样本。他出身网络安全,团队核心成员来自中国第一代安全极客社区“乌云”,公司取了个拉丁文名字Efflora,中文名叫“平等智能”。今年年初,团队完成了过千万元种子轮融资,由Lollapalooza Capital(王慧文家办) 领投、蔚来资本跟投。拿到钱之后,这支不到十人的团队把自己定位成“真实世界的采样器”——在合成数据之外,也更专注于采集真实应用的环境与任务,做成模型公司强化学习需要的专属数据,卖给模型公司做强化学习。用王泉自己的话说,真实世界有无限的分辨率,采样精度高,看到的就是4K;做得粗,可能只有720P。
在这次访谈中,王泉拆解了当前数据市场的真实交易结构:一些头部厂商倾向于内部完成标准化数据生产,外部采购需求更多集中在非标场景;蒸馏和合成也正在收归模型公司内部,真正的窗口属于那些产出周期最长、场景定义最难的非标数据。他也给出了一个尖锐的判断——训下一代模型本质上不是research问题,甚至不是工程问题,而是一个go-to-market问题:你的token卖给谁,决定了你需要什么数据,也决定了你能不能转起数据飞轮。卖不出token,致命之处不在收入,在于收不回用户数据。
关于为什么押注网络安全数据,王泉的解释层层递进,但最打动人的是最后一层:安全攻防天然沉淀了一类极其稀缺的决策数据——在充满迷雾和噪声的环境中综合判断、排兵布阵,而这恰恰是当前AI最薄弱的能力。没有人能给AI搭一个“如何开公司”的训练环境,但安全领域里,这样的环境每天都在真实发生。
访谈末尾,话题从商业滑向了更远的地方。AI用人类几千年的公共知识训练而成,生产力的提升却不会自动惠及每个人。王泉把那种默认“技术红利自然下沉”的乐观叫作“生产力的便车”。他做了几年文学播客,常和朋友聊一个问题:当下整个世界的结构,正在面临着巨变。而他现在想做的事情,某种程度上就是对这个问题的一个回应——在数据这一环,就开始回答:我们到底想要什么样的 AI。
Z Highlights
- 蒸馏和合成数据未来基本会收归到模型公司内部;真正的窗口期是真实的非标场景数据——它产出周期最长,因为场景和环境一开始根本没被定义好,你得先找上游真实用户,一起把场景慢慢定义清楚才能产出。也正因为它门槛高、周期长、别人一时半会做不了,反而给了我们更长的窗口。
- 市场原本的共识是,要真正达到AGI一定不能靠蒸馏、得靠RL,这个共识其实对我们做数商最有利。但我越想越觉得:如果领先模型对普通用户已经接近无感,那单靠蒸馏蒸出一个八九十分的AGI,是真有可能的——当然前提是让不让蒸。
- 大家对“做下一代模型是什么问题”的认知一直在升级:最开始以为是research问题,后来共识说它是工程问题,是infra和data。但我觉得它本质上是一个go-to-market问题——要么你全方位SOTA,要么你极致性价比,否则哪怕是第二名、第三名,token都卖不出去,这非常残酷。
- 最开始判断数据好不好,标准很简单:任务足够长、步数足够多、reward稳定客观,但那个标准里从没提这个任务“是什么任务”。现在光长已经不够了,更重要的是它得是一个“值得解”的任务——甚至也不能靠专家直接标,因为哪怕是专家,他访谈时说出来的任务,和他实际做事过程中产生的任务,往往完全不一样。评判标准,从供给侧转到了需求侧。
- Grok买了Cursor之后推理能力突然上了一大截——因为Cursor里有大量用户的真实场景和数据。你反过来想,Cursor凭什么值那么多钱?产品的壳不值钱,它自己训的模型也不值钱,真正值钱的是用户的真实数据。
- 手工做数据谁都能做,招几个人就能做出几条来;但一旦要大量的、高质量的数据就非常难。所以我们把自己定位成“真实世界的采样器”,本质是因为做数据的核心难点就是scaling。
- 真实世界有无限的分辨率——分辨率取决于你用什么角度去采样:采样精度高、任务做得真实,看到的世界就是4K的;做得不好,可能就是720P。更关键的是,真实世界让verify变得可规模化:真实的淘宝就摆在那,模型做得对不对,拿去和真实淘宝比一下就知道了。
- 搞安全的人最大的特点是特别擅长reward hacking——这本身不是好事,但它意味着你习惯用非常规的、有点奇技淫巧的办法解决问题,而不是走大家都会走的常规路径。这也是我们敢去讲、去探索这个新范式的原因——它本来就是一件跳出常规的事。
- 现在很多团队会默认,只要把生产力提上去,大众自然就能享受红利,我把它叫“生产力的便车”。但今天AI取代工作、裁员都在发生,生产力提升并不会让所有人都搭上便车。所以我们常说:你想要什么样的AI,就做什么样的数据。
01 蒸馏和合成正在收归内部,留给外部数商的窗口越来越窄
ZP:从你这一年的观察来看,模型公司对数据的需求到底在发生什么变化?
王泉:变化非常快,基本每两个月就有一次比较大的变化。但要看清楚,得先理解需求正在分层:一头是还在大量采购的标准化Coding数据——给一个需求,怎么写feature、怎么fix bug;另一头是越来越多厂商开始要的真实、完整的环境数据,同样是Coding,他们关心的是这个需求怎么来的?这个软件的整个供应链、整个生命周期是怎样的?你最开始和客户谈了什么合同、聊天记录是什么、需求怎么讨论、怎么开发,开发完客户到底验收不验收、买不买单、结果好不好。在我们接触的范围内,后一类需求目前仍集中在少数先锋厂商,大多数客户还没进入这个阶段——因为它是非标数据,得我们和模型厂商一起去定义数据的标准、格式,以及怎么定义场景和任务。
如果把过去半年的节奏捋一遍,是这样一条演进线:Coding一直都要,但难度、长度、复杂度在不断往上走;最近几个月开始冒出垂直行业的诉求,比如法律、金融、医疗这些信息化程度高、数据比较好弄的领域;再到现在出现了 Agent和AI for Science的需求。最近新一代模型出来后,GUI很可能又要火起来。所以这个市场不是线性增长,而是一直在换主题。
ZP:那从整个市场来看,现在交易的数据主要是哪几类?分布是怎样的?
王泉:我不确定大家是否了解这个市场的真实结构。过去一段时间,比如过去三个月,市场上交易额的大头其实是那些可被规模化复制、边际成本较低的数据——单笔订单金额比我们这种环境数据大得多,一笔就非常高;我们这种数据单个项目的价格没那么高,但单条价格会很高。
还有一个也许大家不太了解的点:不同厂商对外采数据的态度差别很大。有些团队已经把标准化数据生产内部化,自己搞定大部分常规需求;但对真实环境、尤其是非标场景数据,往往需要跟外部一起定义场景、共建环境。Efflora之所以坚持做真实环境,是因为在我们看来,真实世界的reward是合成不出来的。比如一个真实软件供应链的数据、一个软件做出来客户到底下不下单,这种信号只可能来自真实世界。
ZP:那把数据分类拆开看,未来这个分布会怎么变?哪一类才是真正的窗口期?
王泉:我把数据分成三类来看:合成数据、专家数据、真实的非标场景数据,这三类的命运完全不同。
先说会收缩的。蒸馏数据会越来越少,现在已经在减少了;合成数据也在减少——一是它对模型的边际提升在变弱,二是厂商自己就会合成。所以蒸馏和合成,未来基本会收归到模型公司内部。
再说会长期存在的。专家数据一定持续需要,但越来越难做:现在说的“专家”打引号,其实是各行业入行两三年的一线人员;下个阶段就得要五六年、七八年经验的人去做更复杂的问题,项目难度和成本都越来越高。
而真正的窗口期,是第三类——真实的非标场景数据。它的产出周期最长,因为场景和环境一开始根本没被定义好,你得先投入资源、找上游的真实用户,一起把场景和环境慢慢定义清楚,才能产出数据。专家数据和真实数据解决的是不同的问题,可以这么粗暴地划分。也正因为它门槛高、周期长、别人一时半会做不了,反而给了我们这样的团队一个更长的窗口。
ZP:既然一线厂商很多东西自己做,那用蒸馏这条路还能走多久?
王泉:这个很难说。市场上原本有个共识:真正要达到AGI或SOTA,一定不能靠蒸馏,蒸馏顶多是冷启动,甚至完全不蒸、尽量做RL,像字节Seed就不蒸馏。如果这个共识成立,其实非常有利于我们这种做数商的。
但我最近跟很多朋友聊下来,意识到一个反共识的可能:蒸馏会不会是可以永远蒸下去的?也就是说,不靠RL、单靠蒸馏达到AGI,有没有可能?我觉得不能排除,它真的有可能。这取决于怎么定义AGI。我的定义是:对一个普通用户来说,模型几乎能让他无感使用、能回答他几乎所有问题——除非他是某个领域的专家、问特别复杂的问题,否则日常大部分需求都能解决,我就认为它基本到 AGI了。按这个标准,ChatGPT对普通用户可能已经八九十分了。那如果领先模型已经到这个水平,再过半年对普通人基本无感,去蒸馏它、蒸出一个八九十分的模型,是真有可能的——当然前提是让不让蒸。
ZP:需求这么快地变,头部公司对高质量数据的定义,是不是也在变?
王泉:变化很大,而且方向很关键。最开始大家判断数据好不好,标准很简单:任务足够长、步数足够多,reward稳定客观,就是好数据。因为长程推理是过去半年大家一直在攻克的点,有些厂商到现在都还做不到。
但你注意,那个标准里没有提这个任务“是什么任务”。现在越来越发现,光长已经不够了——海外SOTA模型现在又快又好,你看Codex、Claude实际用起来非常快,一会儿代码就写好了,想找到足够长的任务反而不容易。所以除了长,更重要的是这个任务本身得是一个“值得解”的任务。什么样的任务值得解,是个很有意思的问题。大家希望从真实世界的应用环境里去找任务,而不是靠合成,甚至也不是靠专家直接标——因为哪怕是专家,他访谈时说出来的任务,和他实际做事过程中产生的任务,往往完全不一样。换句话说,评判标准从供给侧转到了需求侧。
这里还有个关键差别:已经有产品化Agent的厂商,能从真实使用里搜集任务和场景,逐渐形成数据飞轮;但不少团队还没形成稳定的真实用户数据回流机制,所以他们其实很难判断什么任务是好任务、什么场景值得解。
ZP:顺着什么任务值得解,其实引出另外一个本质问题,训模型到底是个什么问题?
王泉:对,这是我经常跟人讲的一个判断。大家对“做下一代模型是什么问题”的认知一直在升级:最开始以为是research问题,是训练算法、预训练、后训练的问题;后来形成共识,说它是工程问题,核心是infra和data,数据质量够高、infra够好,就有理由做出好模型。
但我觉得它甚至不是工程问题,本质上是一个go-to-market问题。因为要么你全方位SOTA,要么你极致性价比,否则哪怕是第二名、第三名,token都卖不出去,这非常残酷。国产模型以前打性价比,但现在DeepSeek谁都比不过,其他厂商就得想清楚:我凭什么卖token、别人为什么用我?比如某个模型做网页前端效果特别好,在新一代通用模型出来前它就是最好的,那想创业的独立开发者就都愿意用它,因为大家创业第一步不是做App就是做Web,都想把页面做漂亮。它在“做漂亮页面”这个场景是SOTA,token就卖得出去。
而卖不出去token,还有个更致命的问题:不是收入多少,而是你收不回用户数据。某个模型在某个场景最好→更多人用→数据回流更多→这个方向更领先,这就是数据飞轮。所以训下一代模型,得先想清楚token卖给谁、要解决什么问题;想清楚要解决什么问题,才知道需要什么数据。
这正是我们作为数商的位置。我们的方法是反过来的:先从真实世界找到AI真正的应用场景,不管是垂直领域的企业侧,还是有大量真实用户的AI应用侧,从这些场景拿到真实数据,再倒推去定义rubrics(评分标准)、把它变成可评估、可验证、可训练的环境。因为AI最终一定会落到这些场景里。现在模型厂商的市值虽然锚定的是模型能力而不是收入,但能力也好、落地也好,终点都在具体场景里。我们干的这一环,就是“从场景到环境、到数据”;接上厂商那一环,就是“从数据到模型、再让应用变好、用户变好、数据继续回流”。这个闭环一旦转起来,就是模型在某个场景持续摸高的飞轮。
02 真实世界的reward无法合成,数商的第一性原理是规模化
ZP:你为什么会从一个安全的人,跳到做AI数据?
王泉:有两个触发点。一个很现实:24年开始跟企业客户聊,我明显感觉大家 IT和安全的预算越来越少,同时都想做AI转型却不知道怎么转,我就开始琢磨 AI到底怎么在企业侧落地。另一个偏价值判断——我平时看书多,还做过几年文学、哲学、社科的播客,在那个过程里想清楚了一件事:现在很多硅谷和国内团队会默认,只要把生产力提上去,大众自然就能享受红利,我把它叫“生产力的便车”。但今天你看,AI取代工作、裁员都在发生,生产力提升并不会让所有人都搭上便车。真正要让AI惠及普通人,需要从业者有意识地去影响行业方向。所以我们常说一句话:你想要什么样的AI,就做什么样的数据——这就是我们做数商的初心。
ZP:请你介绍一下Efflora,公司现在主要在做什么?
王泉:Efflora是个拉丁文名字,意思是涌现、涌现生长。
我们核心做AI的数据,尤其是后训练数据。我们不做蒸馏数据,做的基本都是 To B的环境和任务。数据方向很多,我们主要聚焦三块:一是Coding,因为市场需求量最大,也最适合我们做;二是Cyber,就是网络安全数据,它是AI摸高绕不开的高地,至于AI for Science那块不太适合我们团队;三是多模态,因为我们本身一直在做GUI。除此之外,我们也在探索真实场景数据,比如企业端B 端、C端的真实数据。
客户主要两类。一类是各种模型公司和实验室,这是主力;另一类是垂直行业的应用厂商,现在有些垂直领域的公司想训自己的模型。不过我