
作者丨林夕
编辑丨小龙
AI 训练数据赛道,又诞生了一笔大额融资。
9 月 22 日,AI 数据服务商 Snorkel AI 宣布完成 3.5 亿美元 E 轮融资,投后估值达到 35 亿美元(约 235 亿元)。本轮由 Insight Partners 和 S32 领投,Addition、Lightspeed、Greylock、GV、Wells Fargo 等机构跟投。
这距离上一轮融资仅过去 17 个月。
2025 年 5 月,Snorkel 完成 1 亿美元 D 轮融资,估值 13 亿美元。如今,公司估值已接近当时的 3 倍。

资本加速涌入的背后,是一条更陡峭的收入曲线。
Snorkel 披露,目前公司年化收入已达到 3.75 亿美元。一年前,这个数字还只有约 2000 万美元,短短一年增长约 18 倍,公司预计今年实现盈利。
一家不训练大模型、不生产芯片的公司,为什么能获得如此高的增长?
01 从斯坦福实验室出发,先做了一套 " 给数据打标签 " 的软件
Snorkel 的故事,要从斯坦福 AI 实验室开始。
联合创始人兼 CEO Alex Ratner 在斯坦福攻读计算机博士期间,研究的就是机器学习中的数据问题。当时,模型训练仍高度依赖人工标注:专家需要逐条查看数据、判断类别,再将结果交给模型学习。

Alex Ratner
Ratner 想解决的是其中最耗费人力的一环:能不能让专家不再逐条标注,而是把自己的判断规则交给机器,由程序批量处理数据?
2017 年,Ratner 等人在斯坦福 AI 实验室发表 Snorkel 相关论文,提出 " 数据编程 "(Data Programming)方法。专家不再直接给每条数据贴标签,而是编写规则或标注函数,再由系统利用这些规则生成大量训练标签,并处理不同规则之间的冲突。
例如,在医学影像场景中,医生可以定义哪些特征可能对应某种疾病,系统再据此处理大规模数据。专家的作用,从重复性的标注劳动转向制定判断标准。
这套方法很快从实验室走向产业。Snorkel 团队的技术曾在 Google、Intel、Apple、Stanford Medicine 等机构得到应用。经过数年的研究和迭代,2019 年,Ratner 带领团队从斯坦福 AI 实验室分拆,正式创业。

从左至右依次为:Snorkel AI 公司副总裁 Vincent Sunn Chen、联合创始人 Henry Kiss Ehrenberg、联合创始人兼研究主管 Paroma Varma 以及首席执行官兼联合创始人 Alex Ratner
2020 年,Snorkel 推出商业产品 Snorkel Flow。

早期的 Snorkel,本质上是一家数据基础设施软件公司:客户提供原始数据,领域专家通过规则定义如何标注,Snorkel Flow 负责将这套流程自动化。
相比传统的人工逐条标注,这种模式可以用更少的专家处理更大规模的数据,也因此成为 Snorkel 早期商业化的核心。
但它的边界同样清晰:客户仍然需要自己拥有数据、设计任务,并完成整个数据生产流程。
随着大模型进入高速发展期,这一模式开始显得不够。
模型训练所需要的数据,从通用文本逐渐扩展到代码、数学、法律、医疗等专业领域。尤其在后训练阶段,模型需要的不只是 " 标准答案 ",还需要专业人士告诉它为什么一个答案是对的、另一个答案为什么不够好。
Snorkel 也由此开始从数据生产工具向模型评测和专家数据延伸。
2025 年 5 月,公司完成 1 亿美元 D 轮融资,估值达到 13 亿美元。同期披露的案例显示,一家大型美国银行让贷款专家参与构建 AI 系统,用于回答机构客户相关问题,模型准确率从 25% 提升至 93%;AI 销售公司 Rox 使用 Snorkel 生成的评测数据后,模型准确率提升了 10% 至 12%。
这时,Snorkel 已经不再只是帮助客户 " 处理数据 ",而是在参与定义模型应该学什么,以及如何判断模型有没有学会。
2025 年 9 月,Snorkel 开始把自己的专家网络、软件系统和 AI 模型结合起来,直接向客户交付成品训练数据、评测数据和强化学习环境,将业务从传统的软件授权进一步推进到 Data-as-a-Service。
Snorkel 由此完成了从 " 卖工具 " 到 " 卖数据 " 的转身。
02 一年收入涨 18 倍,Snorkel 卖的已经不是 " 标注 "
Snorkel 目前拥有数万名专业人士组成的专家网络,覆盖编程、法律、医疗等领域。专家不再承担大规模、重复性的基础数据处理,而是负责定义任务、设计场景、制定评分标准,并判断什么样的结果才算正确。
剩余的大量工作交给 AI 完成。
Snorkel 会调用不同的专用模型和 AI Agent 参与数据生成、检查和质量控制。今年 9 月,公司披露,在编程 Agent 的数据生产中,单个任务最多可以调用数百个专用 AI 模型进行交叉检查。按照公司披露的数据,这套系统使质量控制效率提升 50% 以上;与单纯依赖通用大模型审核相比,准确率提升超过 15 个百分点。
由此形成了 Snorkel 目前的一套数据生产方法:专家负责定义标准,AI 负责按照标准规模化执行。
过去,一名程序员可能需要花费大量时间逐个判断代码任务;现在,专家更多承担任务设计、规则制定和关键结果判断,数据生成、筛选以及大部分初步质检则由 AI 完成。
这改变的不只是生产效率。
当专家的判断被转化为规则、任务和评价体系之后,它就不再只能用于一次数据生产,而可以持续生成新的任务和反馈,再用于训练和优化模型。Snorkel 将这一过程称为数据开发的 " 递归自我改进 " 循环:AI 帮助专家提高数据生产效率,专家产生的反馈又被用于改进 AI 系统。

这也是公司收入快速增长的一个重要背景。
过去一年,Snorkel 的年化收入从约 2000 万美元增长至 3.75 亿美元。客户购买的也不再是一支外包标注团队,而是一套能够持续生产训练数据、评测模型并支持模型迭代的数据基础设施。
目前,Snorkel 的客户覆盖前沿 AI 实验室、大型云厂商、企业以及美国政府机构,其中编程数据是需求最集中的领域之一。
与此同时,公司正在向更复杂的数据产品延伸:强化学习环境。
这也是 Agent 时代对数据提出的新要求。
对于传统聊天模型,人类可以通过 " 问题—答案 " 的形式判断模型表现。但当模型开始自主执行任务,仅仅提供正确答案已经不够。
以代码 Agent 为例,它需要进入代码库、定位 Bug、修改代码、运行测试,并根据测试结果决定下一步操作。训练这样的 Agent,需要一个能够模拟真实工作流程的环境:Agent 可以在其中执行操作,系统记录状态变化,并最终根据可验证的结果判断任务是否完成。
Snorkel 正在提供的,正是这样的环境。例如,公司曾与保险行业专家合作搭建模拟保险承保环境:Agent 获得企业资料、数据库和承保规则后,需要按照真实业务流程完成承保判断,再由系统依据专家制定的标准评估结果。
03 AI 数据生意,正在分成几条路线
Snorkel 并不是唯一一家押注 AI 数据的公司。过去两年,Scale AI、Mercor 等公司都在快速扩大这门生意。
Scale AI 最早从数据标注切入,客户把模型训练、评测等任务交给平台,再由 Scale 组织标注员、领域专家和软件系统完成数据生产。随着大模型进入后训练阶段,其业务已经扩展到数据采集、生成数据、RLHF、模型评测和安全测试等环节。
2025 年 6 月,Meta 以 143 亿美元投资 Scale AI 约 49% 的股份,使其投后估值达到约 290 亿美元。

Mercor 更接近一个面向 AI 公司的专家网络:平台聚集程序员、医生、律师、研究人员等专业人士,再将他们匹配给 AI 公司,完成模型训练、评测和人工反馈。

Mercor 创始人,从左至右:首席技术官 Adarsh Hiremath、首席执行官 Brendan Foody 和首席运营官 Surya Midha
Snorkel 则将软件、专家网络和 AI 模型结合起来,让专家负责定义任务、设计场景和制定评价标准,再由 AI 承担大规模的数据生成、筛选和质量控制,最终向客户交付训练数据、评测数据和强化学习环境。
三家公司背后的商业模式也因此出现了差异:Scale AI 强调规模,Mercor 强调专家,Snorkel 则试图把专家知识产品化。
随着 AI 训练从数据标注走向后训练和 Agent 开发,三家公司的业务边界也在逐渐重合。Scale AI 从数据标注进入模型评测和 RLHF,Mercor 从专家网络延伸至 Benchmark 和强化学习环境,Snorkel 则从数据生产软件走向成品数据和 Agent 训练环境。
这种分化在国内也正在发生,只是国内公司的路线更加分散。
一部分公司仍然在传统 AI 数据服务的基础上向大模型训练延伸。海天瑞声、数据堂、标贝科技等公司,已经从数据采集、标注进一步进入大模型训练数据、模型评测和高质量数据集等业务。这类公司的核心能力,仍然是把数据采集、加工、标注和交付做得更大、更快、更稳定,商业模式与早期的 Scale AI 更为接近。
另一部分公司则开始进入 Physical AI 的数据采集。
手亿通过腕带、头戴设备等硬件,把人的真实操作转化为机器人训练数据;星忆进一步向高自由度、多模态物理交互数据延伸;真觉万象则围绕可穿戴采集、力学解码和数据对齐等环节搭建 Physical AI 数据基础设施。
它们解决的是另一个问题,机器学习所需要的真实世界数据,究竟从哪里来?
这也让 AI 数据产业开始出现越来越清晰的分层:有人负责采集数据,有人负责加工和标注,有人负责把专家知识转化成训练数据,还有人开始直接设计 AI 训练和试错的环境。
从这个角度看,国内外 AI 数据公司的竞争,正在从 " 谁能生产更多数据 ",走向谁能够控制数据生产链条中的更高价值环节。
对 Snorkel 而言,它真正押注的,也不再是 AI 公司还需要多少人来标数据,而是专家知识能否被软件和 AI 规模化,最终变成一种可以持续交付的数据基础设施。
如果这条路径成立,AI 数据公司的生意就会从 " 卖人力 " 进一步走向 " 卖知识、卖数据,以及生产这些数据的系统 "。
而这场竞争的下一站,可能已经不再是谁能生产更多数据,而是谁能为 AI 生产出更好的任务和更真实的训练环境。
本文为创业邦原创,未经授权不得转载,否则创业邦将保留向其追究法律责任的权利。如需转载或有任何疑问,请联系editor@cyzone.cn。


登录后才可以发布评论哦
打开小程序可以发布评论哦