收入暴涨16倍,融资23亿:一家AI数据公司爆了
9 小时前 / 阅读约6分钟
来源:36kr
Snorkel AI从卖AI标注软件转向直接向AI公司卖训练数据,年化收入从2000万美元涨到3.5亿美元以上。Micro1、Handshake等公司也通过提供AI训练数据实现收入快速增长。最贵的数据依赖专业人士,数据公司需考虑如何降低人力成本。

卖AI数据,一年收入暴涨16倍,融资3.5亿美元。

它叫Snorkel AI。过去主要卖AI标注软件,2025年开始,它直接向AI公司卖训练数据。

一年前,Snorkel的年化收入还只有约2000万美元。现在,已经超过3.5亿美元。9月22日,又完成3.5亿美元(约合人民币23.5亿元)E轮融资,估值达到35亿美元(约合人民币235亿元)。

过去的数据标注,常见工作是给图片框汽车、给文本贴标签。现在,前沿模型需要程序员设计复杂代码任务,需要律师、医生、博士判断模型到底错在哪里。

大模型越来越聪明以后,AI公司缺的已经不只是“更多数据”,而是“更难、更专业、能让模型继续进步的数据”。Snorkel就在卖这种数据。

卖数据,收入暴增

Snorkel从斯坦福大学的实验室发迹。

2015年,亚历克斯·拉特纳(Alex Ratner)还在斯坦福读计算机博士。他不到30岁,本科在哈佛学物理,曾有过一次失败的创业经历。

有一天,导师克里斯托弗·雷让拉特纳研究一个看起来不起眼的问题——斯坦福医学院等机构有大量数据,却花不起时间逐条人工标注。

拉特纳和团队做了Snorkel项目:专家不用亲自标几万条数据,而是把自己的判断写成规则,再让机器批量标注数据,然后可以用。

这个项目在斯坦福AI实验室做了4年多, 2019年,团队把项目从实验室拆出来,成立Snorkel AI。雷也成了Snorkel的联合创始人。

(八卦一下,SambaNova、Together AI这两家超级独角兽,也是雷参与的。)

公司最初把这套技术做成软件卖给企业,核心产品Snorkel Flow帮助谷歌等客户自己生产、整理和管理训练数据。

到了2025年,Snorkel的生意变了。

拉特纳发现,客户不再只是买软件自己做数据,而是直接把问题交给Snorkel:代码为什么运行失败,一份法律意见有没有遗漏关键风险,或者一道物理推理题究竟错在哪一步。

Snorkel变身辅导老师。公司负责找专家、设计任务、写评分标准、做质量检查,最后交付可以直接拿去训练的数据和强化学习环境。

这项新业务推出不到一年,Snorkel的年化收入就从约2000万美元涨到3.5亿美元以上。公司目前服务前沿AI实验室、云厂商、大型企业和美国政府。

最新赚钱趋势:给AI判卷

一批卖高质量数据的公司兴起。

比如Micro1,它最初做AI招聘。后来公司发现,数据客户正在通过它的平台寻找工程师,让这些工程师给模型做训练任务,于是直接进入AI数据业务。

2025年底前后,Micro1年化总收入约1亿美元。到今年8月,这个数字已经达到5亿美元。它现在组织医生、律师、科学家等专业人士,为AI公司生产训练数据。

还有Handshake。

它是一家做了十多年的美国高校招聘平台。AI训练需求起来后,这张高校人才网络有了新用途:律师检查法律回答,医生判断医学推理,博士给模型设计专业难题。

这项业务刚起步时,Handshake的年化总收入只有500万至1000万美元;今年1月达到5.5亿美元,到4月已经接近10亿美元。扣掉支付给专家的钱后,相关年化收入接近3亿美元。

Snorkel、Micro1和Handshake原来的生意各异,但收入快速增长都发生在一个变化之后:开始直接替AI公司生产训练数据。

Turing最初靠远程软件工程师招聘和人才匹配起家,后来成为大模型厂商的训练数据供应商,客户包括OpenAI、Google、Anthropic和Meta。

2025年初,Turing披露,上一年收入达到3亿美元,是此前的3倍,并且已经实现盈利。单是一条复杂训练数据的成本,甚至可以达到数百美元。

和Snorkel一样,这些公司本质上就是给AI出题、判卷。

为什么一道题能值几百美元?因为真正懂这个领域的人,很贵。

Turing因此建立了一个超过400万人的专家网络,其中包括程序员和博士。需求量同样很大,Meta训练Llama 3时使用的人工标注数据超过1000万条。

Mercor把这门生意推到了更大的规模。

这家公司2023年成立时做的也是AI招聘,后来开始组织物理、金融、软件工程等领域的专业人士,为模型公司回答问题、设计任务和评价输出。

今年6月,Mercor年化总收入已经超过20亿美元,比年初翻了一倍。不过其中大约60%至70%需要支付给专家和承包商,对应的年化净收入约6亿至8亿美元。

Snorkel一年超过16倍的收入增长说明,模型公司对复杂数据的采购仍在快速增加。

这门生意国内也出现了。

海天瑞声是国内较早从事AI训练数据的上市公司。2026年上半年,公司实现营业收入1.92亿元,同比增长22.45%;归母净利润977万元,同比增长156.87%。

更有意思的是不同数据业务的成本。

半年报显示,上半年海天瑞声训练数据定制服务收入约1.33亿元,成本约9322万元;训练数据产品收入约3582万元,成本只有约27万元。公司解释,定制服务的数据不能重复卖给其他客户,而拥有自主知识产权的标准化数据产品开发完成后,可以多次销售授权。

两类业务的成本结构差异很大。

最贵的数据,越来越依赖真正的专业人士。

如果收入增加一倍,同时也要增加一倍律师、医生和程序员,规模虽然能做大,利润未必同步增长。

这也是数据公司下一步要算的一笔账:专家数据需求还在增长,但如果每收到一笔钱都要重新组织一批人,收入越大,人力成本也跟着增加。如果能把专家经验做成可以重复销售的数据产品、评测系统或者强化学习环境,赚钱方式就会发生变化。