Harvey 以 Kimi K3 为底座打造自有法律模型,验证 " 强开源底座 + 垂直后训练 " 路径,AI 应用公司正从模型调用者走向能力拥有者。
撰文|张贺飞
编辑|沈菲菲
一个礼拜前,美国法律科技公司 Harvey 在 X 上官宣了一则消息:隆重推出基于 Kimi K3 训练的首个自有模型 Harvey Tenet。
消息一出,迅速在 AI 圈掀起了一场波澜。
基于开源模型后训练的事已经屡见不鲜。早在 3 月份,Cursor 的自研编程模型 Composer 2,就被扒出是基于 Kimi K2.5 训练的;DoorDash、Airbnb 等企业,也纷纷部署开源模型进行 " 降本 "。
为何一家法律科技公司的 " 自有模型 ",在国内外引发了如此大的关注?答案在于:Harvey 可能是最不应该选择中国模型的 AI 公司。
诞生于 2022 年的 Harvey,先后获得了 OpenAI、红杉资本、a16z 等机构的注资,市场估值已经达到 110 亿美元,全球 75 家以上 Am Law 100 律所都是 Harvey 的客户。而且 Harvey 的产品原型就是建立在 OpenAI 模型上的,双方还曾合作训练面向美国判例法的定制模型。
正是这样一家被视为 OpenAI" 亲儿子 " 的公司,在训练自己的第一款基础模型时,选择以中国的开源模型为底座。
- 01 -
OpenAI 的 " 亲儿子 ",为什么要独立求生?
Harvey 与 OpenAI 的关系,远非寻常的 " 投资者与被投资者 "。
一位创始人曾是证券和反垄断律师,另一位创始人有过 DeepMind 和 Meta 的工作经历。两人最初只是用 GPT-3 测试法律问答,随后获得了 OpenAI Startup Fund 领投的 500 万美元种子融资。
在 Harvey 的早期故事里,OpenAI 既是资本来源,也是最重要的技术靠山。
到了 2023 年,Harvey 完成 8000 万美元 B 轮融资时,OpenAI 和红杉资本继续参与。Harvey 在融资公告中明确表示,公司正在与 OpenAI 合作开发面向专业服务行业的领域模型。

双方的分工一度非常清晰。
OpenAI 负责提供越来越强的通用模型,Harvey 负责理解律师、法律文件和律所工作流,再把模型包装成法律行业可以使用的产品。OpenAI 拥有模型,Harvey 拥有客户,双方处在产业链的上下游。
可当基础模型公司开始进入应用层,上下游关系出现了裂痕。
时间来到 2026 年,合同管理软件公司 Ironclad 的联合创始人 Jason Boehmig 加入 OpenAI,负责开发面向法律行业的产品,直接与大型律所合作。站在 Harvey 的立场上,过去的盟友正在成为潜在竞争者。
如果 Harvey 最核心的能力始终建立在 OpenAI 等闭源模型之上,OpenAI 在内的上游模型厂商一旦直接进入法律工作流,Harvey 就很难形成真正独立的技术边界和竞争壁垒。
这也是大多数 AI 应用公司的困境。
当基础模型的能力还在快速进步时,应用公司依靠提示词、知识库和工作流建立起来的优势,随时可能被下一次模型更新覆盖。昨天还需要专门开发的功能,明天可能就会成为通用模型的标准能力。模型供应商只要向下走一步,就可能吃掉应用公司的价值。
除了生存压力,Harvey 还面临另一个问题——成本。
Harvey 联合创始人 Gabe Pereyra 在媒体采访时表示:2026 年 1 月至 6 月,Harvey 平台每月消耗的 Token 数量从约 1 万亿增长到了 14.5 万亿,半年增长超过 14 倍。模型调用正在从技术采购费,变成影响毛利率的成本中心。
原因并不难解释。
不同于一问一答的聊天机器人,一个法律 Agent 可能要读取数百份文件,连续搜索判例,反复调用工具,对不同结论进行验证……任务越复杂,调用链条越长;Agent 越普及,Token 消耗增长越快。
由此形成了一种隐蔽的成本陷阱:客户和收入属于 Harvey,但伴随业务规模不断增长的模型成本,则在持续流向供应商。对于一家估值 110 亿美元、试图成为法律 AI 基础设施的公司来说,这种结构很难长期维持。
- 02 -
开放的 Kimi K3,制造了一次 " 出逃 " 机会
Kimi K3 代表的开源模型,为 Harvey 制造了 " 逃离 "OpenAI 的机会。
2026 年 7 月,月之暗面正式开源了 Kimi K3,总参数达到 2.8 万亿,支持百万 Token 上下文,重点能力指向编程、知识工作和长周期 Agent 任务。
独立 AI 评测平台 Artificial Analysis 使用 Harvey LAB-AA 对 Kimi K3 进行了详细测试:在衡量法律交付物质量的通过率评测中,Kimi K3 以 94.6% 的通过率排名第一,超过 Claude Fable 5;在更严格的 " 整项任务全通过率 " 评测中,Kimi K3 以 26.7% 的成绩位居第一,接近第二名 Claude Fable 5 的两倍。

Kimi K3 并没有在所有测试中全面超过最强闭源模型,但差距已经缩小到足以改变企业选型。
对于 Harvey 而言,第一次看到了开源模型替代闭源模型的可行性:律师的工作很少是回答一道孤立的问题,通常需要模型在大量材料中持续工作,建立事实关系、识别冲突、判断风险、补充引用,一个模型的 Agent 能力、对复杂知识的处理能力,远比 " 答对一道题 " 有价值。
让 Harvey 下决心基于 Kimi K3 做后训练的,还有两个不可或缺的因素。
第一个是价格。
第三方评测平台 Arena 的数据显示,Kimi K3 位于能力—成本的帕累托前沿,以约 0.62 美元的任务成本,取得约 +10.5% 的综合净改善,不足 Claude Opus 5 ( Max ) 的 1/5;硅谷知名天使投资人杰森 · 卡拉卡尼斯则表示,Anthropic 和 OpenAI 的一些大客户部署 Kimi 后,成本降低了 90%。

第二个是权限。
有别于闭源模型调参数、写提示词的局限性,Harvey 可以在 Kimi K3 的基础上修改模型,适应自己的法律数据、任务环境和评价体系;可以根据任务成本优化推理路径;可以选择不同基础设施部署……一个向 Harvey 出售智能,另一个允许 Harvey 把智能变成自己的生产资料。
按照 Harvey 在官方技术博客中公开的信息:并非简单 " 拿法律材料微调 ",搭建了约 1750 个法律任务环境,将律师的事实判断、引用要求、风险评级、修改建议和交付格式拆成可评分的专家标准,让模型反复完成完整任务,再用律师制定的标准进行打分,通过强化学习把更好的工作方法写进模型。
Legal Agent Bench 的测试结果显示:Tenet 的 " 整项任务全部通过率 " 为 19.7%,高于 Fable 5 的 11.5% 和 GPT-5.6 Sol 的 2.5%;在企业法律任务组成的 APEX Agents 测试中,Tenet 得到 74.0%,同样高于 Fable 5 的 67.4% 和 GPT-5.6 Sol 的 60.3%。目前 Tenet 仍处于研究预览阶段,但已经在 Harvey LAB 测试中达到 SOTA。
简单来说,Kimi 提供的是前沿通用能力,Harvey 负责让模型像一名律师一样工作:先读什么,如何搜索,怎样判断证据是否充分,什么时候应该提示风险,最后以什么格式交付成果。
- 03 -
从 1 到 N,AI 应用的 " 普罗米修斯 " 时刻
Harvey 迈出的一小步,可能是改写 AI 应用市场格局的一大步。
一个不应该被忽略的细节在于:Tenet 的后训练仅用了约 150 块 NVIDIA B300,只花了两个月的时间。
用极低的算力和成本,验证了一条可以被其他行业复用的路径,点燃了垂直 AI 公司自主造模的 " 火种 ",即开放权重模型+行业专家数据+任务评价环境+后训练=专有的垂直模型能力。

很长一段时间里,打造前沿模型都是少数 AI 公司的游戏。
从零训练一款通用基础模型,需要巨额算力、海量数据、完整的研究团队和持续迭代的基础设施。法律、医疗、金融、制造等行业公司,即使掌握大量专业知识,也无法参与模型本身的建设。通常只能接入闭源 API,然后在外层增加提示词、知识库、工作流和产品界面。
这种模式创造了第一代 AI 应用,却也带来了一个问题:应用公司拥有场景,却没有完全拥有能力。
Harvey 提供了另一种可能。
无须重新预训练一个通用模型,而是基于 Kimi K3 等开源模型,直接训练法律工作所需要的专业能力。后续出现了更强的开放模型,还可以将任务环境、评价标准和反馈数据迁移到新的底座上。
模型门槛向下拉的同时,行业知识的门槛将被向上推。
未来最有能力复制 Harvey Tenet 路线的,不会是所有接入大模型的创业公司,需要同时具备四项资产:真实业务数据、行业专家、可量化的评价标准,以及能够形成反馈闭环的客户工作流。
比如医疗公司需要知道,什么样的诊疗建议存在遗漏,什么证据不足以支持结论;金融公司需要定义风险评级、信息引用和合规边界;制造企业则需要把故障判断、工艺经验和操作规范拆解成模型可以评分的任务……这些标准很难从公开语料中获得,可以说是垂直公司构建壁垒的绝佳机会。
诚如 Harvey 官方的表态:下一步要把算力从 1000 卡扩到 10000 ,做全参数微调,还要尝试更多开放底座 ...... 目标是让每家律所都能拥有自己的专有模型。韩国 Digital Today、Global Economic、日本 Livedoor 等媒体已将 Harvey 案例写入 " 垂直 AI 公司摆脱前沿模型 API 依赖 " 的产业趋势。
做一个预判的话,AI 应用公司不再只是基础模型能力的经销商,新的商业飞轮已经形成:客户越多,任务环境越丰富;专家反馈越多,评价体系越精确;模型能力越强,产品与通用大模型之间的差异也就越大。
当越来越多的 AI 应用公司转向开源模型,将彻底打破 " 只有闭源顶级大模型才能支撑商业应用 " 的固有认知,将开源模型从 " 低成本平替 ",推向 " 产业数字基础设施 " 的核心地位,让 " 强开源底座 + 深度垂直后训练 " 成为千行百业数智化转型的新范式。
- 04 -
写在最后
Harvey 基于 Kimi K3 打造自有模型的故事,看似是一次单纯的技术选型更迭,却可能在应用层引发一场 " 独立战争 "。
大模型竞赛的下半场,聚光灯正在发生偏移。只能套壳的 AI 应用或将成为上一个时代的产品,千千万万个 "Harvey" 组成的去中心化、专业化的垂直行业模型,将以前所未有的速度拔地而起。
与此同时,中国的开源模型陆续占领全球 AI 应用公司的底座,将成为闭源巨头无法撼动的事实。
《Gartner 重排存储座次》
《国泰海通为何先建一座 " 算力工厂 "?》
《AI 一体机迎来价值重估》
《中国地毯之乡在拼多多上找到了新增量》
点 " 推荐 ",变好看哦。


登录后才可以发布评论哦
打开小程序可以发布评论哦