

作者 | 铅笔道 松格
编辑 | 铅笔道 黄小贵
图片|铅笔道制图
一家成立不到一年的 AI 公司,正在拿下 20 亿元融资。
据报道,阿里巴巴拟领投 UniPat 新一轮约 3 亿美元融资,腾讯、红杉中国等参与,公司估值约 25 亿美元,折合人民币近 170 亿元。
UniPat 给 AI 出题、判卷,告诉模型哪里做错了。
这门生意已经开始赚大钱。
2024 年,AI 数据与评测公司 Surge AI 收入约 12 亿美元;Mercor 今年披露的年化总收入已超过 20 亿美元;Scale AI 去年收入也已逼近 10 亿美元。
一年冒出三家十亿美元生意
UniPat 成立于 2025 年末。创始人李宽是 90 后,本科毕业于北京航空航天大学,硕士毕业于中国科学院计算技术研究所,目前在香港科技大学计算机科学与工程系攻读博士,研究方向包括 LLM Agent。创业前,他曾作为实习生在阿里通义 DeepResearch 参与后训练研究,重点包括数据合成和强化学习。
后训练解决的核心问题之一,是让已经完成预训练的模型继续 " 变聪明 "。模型会做多少题并不够,训练团队还要知道:什么答案算好,错在什么地方,哪种反馈最值得拿去继续训练。
UniPat 把这件事做成了产品。一位在头部大厂 AI 智能体项目负责人告诉铅笔道,UniPat 取代智能体研发项目中,原本测试团队要做的事情,把整个评估过程,打包成产品来评估 AI 任务执行的完善程度,切中了刚需。
目前最直接的赚钱方式,是把专业人士的判断卖给大模型公司。
Mercor 为 OpenAI、Anthropic、Google DeepMind 等组织程序员、律师、金融从业者和科学家,让他们出题、写答案、评价模型输出,再把数据交给客户做后训练。公司最初做 AI 招聘,后来发现,最舍得为高端人才付钱的是大模型实验室,于是转向 AI 训练。
据 Forbes 报道,Mercor 今年 6 月的年化总收入超过 20 亿美元,比 2 月的 10 亿美元又翻了一倍。公司今年上半年总收入约 6.14 亿美元,其中约 91% 来自基础模型公司。
但 20 亿美元不是纯软件收入。约 60% 至 70% 的流水要付给专家。Mercor 赚的是撮合差价,更重要的是快速找到合适专家、控制交付质量。
Handshake 走的是同一条路。它原本是大学生招聘平台,手里有高校、学生和校友网络。2025 年切入 AI 训练后,不到一年,这项业务的年化总收入接近 10 亿美元;扣除专家报酬后,年化净收入约 3 亿美元。
Surge AI 则更像一家高毛利的数据服务商。创始人 Edwin Chen 曾在 Google、Facebook 和 Twitter 工作。公司 2024 年收入约 12 亿美元,客户包括 Google、Meta、Microsoft 和 Anthropic。
Surge 卖的同样是人类反馈和高质量数据,但它把业务往更高价值环节推:不只是找人做题,而是设计任务、评分标准、评测集和训练环境。相比单纯的人力撮合,这更接近一套 AI 后训练服务。
这几家公司赚的是同一笔钱:模型越强,越需要更专业的人告诉它哪里错了。
-02-
好答案,很值钱
行业之所以从标注走向评测,原因很简单:模型已经越来越会考试。
早期训练数据的问题是 " 有没有答案 "。今天的问题变成了 " 什么答案才算真正好 "。让 AI 识别一只猫,可以用一个标签解决;让 AI 修改一个大型代码仓库、做一份投行分析、完成医院行政流程,很难只用 " 对 / 错 " 两个字评分。
这时,评分标准本身就成了数据。
UniPat 今年推出的 ExpertEval 覆盖医疗、金融和法律三个领域,共 3213 个专家案例、207 个场景,每个案例平均设置 21.83 条评分标准。它不仅看结论,还检查证据、推理过程和高风险错误。这些评分结果可以继续用于后训练。
它的 Monthly-SWEBench 则每月从最新关闭的 GitHub 任务中抽题测试模型。题库必须不断更新,因为公开 Benchmark 很快会被 " 刷题 ":分数上涨,不等于真实工作能力同步提高。
它的 SaaS-Bench 更接近真实工作。UniPat 把 Agent 放进 23 套可运行的 SaaS 系统,要求完成报销、关账、项目管理、医疗行政等任务。结果目前最好的模型虽然能完成不少中间步骤,但端到端完全完成任务的比例只有 3.8%。
这 3.8% 恰恰是这类公司的生意。如果 Agent 已经能稳定完成 99% 的工作,评测公司的价值反而会下降。正因为模型频繁失败,AI 实验室才需要不断找新题、找错误、设计评分规则,再把失败样本送回训练。模型每升级一次,这个循环就可能重来。
Scale AI 也经历了类似升级。它从自动驾驶数据标注起家,后来进入高质量训练数据、模型评测、红队测试和政府项目。2025 年,Meta 斥资 143 亿美元取得其 49% 股份,公司估值升至 290 亿美元。
这类公司的价值是能否持续发现模型不会做的事,再把失败原因变成训练信号。模型每升级一次,新的评测和训练需求就会再来一遍。
-03-
下一笔钱
行业正在寻找比 " 按人头卖数据 " 更好的商业模式。新的方向叫 RL Environment,也就是强化学习环境。
可以把它理解成给 Agent 搭一间 " 模拟公司 "。里面有邮件、CRM、代码库、财务系统、客户工单和各种工具,AI 不只是回答一道题,而要连续完成几十甚至几百步操作。系统再根据结果自动打分,让模型反复练习。
这比传统标注更难,也更接近软件产品。传统模式需要不断招人、派单、验收,收入增长往往伴随人工成本增长;训练环境一旦搭好,可以被不同模型反复调用,并持续生成新的训练轨迹和反馈信号。
Surge 已经成立专门团队建设这类环境。今年它发布的 EnterpriseBench CoreCraft 模拟了一家客户支持公司,包含 2500 多个实体、23 种工具,让 Agent 处理多步骤工作。Mercor 也在 7 月收购了专门做强化学习环境的 Deeptune,并明确把编码、医疗、法律等领域的训练环境作为下一阶段业务。
Handshake 则开始把另一种稀缺资源拿出来卖:企业真实运营数据。它公开向企业征集经过脱敏的业务数据,根据数据规模和价值,一份合作可支付 10 万至 400 万美元以上,再把整理后的数据提供给前沿 AI 实验室用于训练和评测。
这说明这门生意正在形成三层收费:第一层卖专家时间,第二层卖整理好的训练数据和评分标准,第三层卖可以持续产生训练数据的环境。越往后,越接近基础设施。
当然,这门生意还没有摆脱人力服务。Mercor 约六至七成流水需要付给专家,客户又高度集中在少数头部 AI 实验室;Scale 在 Meta 入股后遭遇部分客户关系变化,也说明 " 中立第三方 " 本身就是一种资产。
本文不构成任何投资建议。
欢|迎|联|系
想获得调研,请联系:qianbidao01
想加入社群,请联系:qianbidao01
想市场合作,请联系:qianbidao01
文章转载,请联系:qianbidao01


登录后才可以发布评论哦
打开小程序可以发布评论哦