来源:Z Potentials

Z Highlights
Sonya Huang 是 Sequoia Capital 合伙人,长期关注 AI 基础模型、应用层与开发者工具。随着开放权重模型逼近前沿水平、后训练基础设施逐渐成熟,越来越多 AI 应用公司开始重新评估哪些智能能力应当自建、哪些能力适合继续向前沿实验室购买。
01 开放模型追上来之后,企业 AI 开始争夺控制权
要求企业 " 拥有自己的智能 " 的声音越来越响。Alex Karp 最近鼓励企业 " 掌握生产资料 ";不久后,Satya Nadella 表示,从前沿实验室购买智能相当于付费两次:第一次支付金钱,第二次交出让智能真正有用的专有知识。所有人都在问同一个问题:企业核心的智能究竟应该由谁拥有?
这里需要说明,企业并非一定要拥有自己的智能,也不等于建议企业离开前沿实验室。对于许多工作负载,使用前沿模型的 API 和 Agent 依然是合适的选择。Sequoia 在投资组合中观察到,越来越多公司开始为产品中的部分功能构建自有 AI 能力,通过纵向整合逐步拥有并塑造模型权重。
几周前,Sequoia 召集一批 AI 公司的创始人和开发者,围绕 " 拥有自己的 AI 栈 " 举办活动。Harvey 从客户需求出发分享实践,Mercor、LangChain、Trajectory 和 Fireworks 则介绍后训练技术栈的各个组成部分。这些分享共同勾勒出一套清晰的方法。
第一,开放权重模型追赶前沿水平的速度超出预期。Kimi K3 和 GLM 5.2 表现非常出色。过去,在开放模型上训练像在跑步机上奔跑:团队花数月微调,下一款前沿模型一发布,这些努力带来的优势就可能消失。如今,企业可以从非常接近前沿水平的基线开始。
第二,独立后训练栈已经成熟。Mercor 和 Fireworks 等公司让每家企业都能使用前沿研究实验室级别的技术栈,从训练、推理到真人或合成数据一应俱全。借助扎实的 evals、Harness 工程、后训练和在线学习,开放模型如今可以在特定领域超过前沿模型。
一年前,选择开放权重意味着愿意牺牲性能;今天,是否采用开放权重模型,正成为关乎企业生存的战略问题。最新战场是智能层,产品与权重都只是这场竞争的一部分。

Sequoia Capital
02 当 AI 成为核心成本,企业开始重新算账
不存在适用于所有公司的统一答案。除性能外,产品的一些环节可能因以下因素而受制于 " 租用智能 " 的方式。
速度。在代码补全或网络安全等领域,速度极为重要,经过蒸馏的小型定制模型可能优于大型通用模型。
专有数据。如果反馈、evals、客户互动或领域数据能够让系统进步,企业可能更希望这些数据留在内部。
掌控自己的命运。应用层与智能层开始融合。实验室向上进入产品,应用公司向下进入决定产品如何思考的训练循环。要掌控产品,就越来越需要掌控学习循环和智能本身。Harvey Research、RampLabs、Glean、Factory 等公司已经在探索这条路径。

03 从 0 到 1 路线图:评测、Harness、后训练与在线学习
当企业确定哪些智能能力要自建、哪些继续采购,接下来的问题是:如何从零走到一?
组建团队。不要把这项工作硬塞给平台团队。拥有智能需要一支主动探索的团队:构建 evals、打磨数据、试验开放模型、调优 Harness,并持续提升模型在特定领域的表现。小型新团队与少数生态伙伴合作,就能取得很大进展。Harvey 仅用七人团队就完成了数量惊人的研究。
让外界看见并理解你的工作。如今,每位买家都在挑选自己看好的 AI 公司;当候选公司的实力相近时,公开的研究成果、基准测试或技术文章越来越能左右最终选择。如果企业在内部完成了优秀研究,应与生态分享。
执行技术步骤。下面是一套总体框架。

1.Evals
Harvey 的 Gabe Pereyra 概括得很好:" 没有好的基准,就无法训练模型。"eval 是一组用来衡量系统能否把工作做好的任务。每项任务包含 Prompt、模型可使用的上下文,以及评分机制。许多 eval 最初都始于创始人查看模型输出、凭经验判断结果是否正确;目标是把这种判断转化为可重复的流程。
Harvey 把真实法律工作拆解成离散任务,建立 Legal Agent Benchmark。第一版涵盖 24 个法律实践领域的 1200 多项 Agent 任务,并使用专家编写的 75000 多条评分准则进行评估。
在决定拥有自己的智能之前,企业必须先有 eval。当每次前向传播都有评测结果可供参考时,选择模型就有了量化依据,无需再凭猜测做决定。
2.Harness 与上下文工程
一个 Agent 由三部分组成:模型、上下文和 Harness。Harness 管理模型周围的产品逻辑,包括路由、检索、工具、记忆、回退和 Trace。Harrison Chase 的简洁定义是:"Harness 的主要职责,是在正确的时间把上下文交给模型。" 任务越偏离模型训练分布,开箱即用的 Harness 表现就越差。
优秀的 Harness 可以把任务路由到最合适的模型,在不同模型间复用同一组 evals,并决定 Agent 可获得哪些上下文和工具。它也让 Agent 的运行过程可供检查:团队能够追踪输入了什么上下文、调用了哪些工具,以及流程卡在何处。
3. 后训练
后训练涵盖多种技术,具体采用哪种技术,取决于团队希望改善什么。Lin Qiao 给出了一套清晰的判断方法:模型缺少事实时无需后训练,使用上下文或 RAG 即可;输出格式或行为不正确时,使用监督微调;需要调整产品的风格与偏好时,使用偏好调优;模型需要提升专项任务能力时,使用 RL;模型太慢或太贵时,对它进行蒸馏。
目标是选择能够改善 eval 结果、投入最少的方法,再通过同一套 Harness 提供模型服务,并在运行中测量质量、延迟和成本。
4. 在线学习
系统拥有 evals、Harness 和模型之后,最后一步是在生产环境中持续改进。Arjun Karanam 提出一个重要观察:模型不断变聪明,每次开启新 Session,却仍像第一天上班。把 Terence Tao 放进会计师事务所,他至少在第一天很可能还不是最好的会计师。系统缺少的是经验,而非智能;Agent 会在运行过程中创造这种经验。
Trajectory 是 Agent 执行任务所经过的路径,包括模型看到的上下文、调用的工具和 sub-agents、生成的答案,以及用户编辑、撤销或重试的内容。要建立在生产环境中持续改进的循环,就必须使用 LangChain 的 LangSmith 等工具捕获这些 Trajectory。失败的任务可以转化为 eval,缺失的信息可以补入上下文或记忆,工具响应中的错误则可以用来指导 Harness 修复。
04 更低的下限,更高的上限
买家需要警惕:拥有自己的智能会打开潘多拉魔盒。闭源模型栈很简单:调用前沿模型,使用 Claude Code 或 Codex 等开箱即用 Harness,加入 Prompt 和上下文,然后发布。它提供较高的能力下限,但上限也相对较低。
拥有技术栈意味着自行承担更多系统工作。生产栈由开源模型、定制 Harness、工具和上下文组成;开发栈由专有 evals、领域数据和在线学习循环组成。工作量确实更大,能力下限可能更低,但上限也会更高。

前沿实验室会继续构建巨型 " 大脑 ",所有人都应该使用它们。与此同时,最优秀的产品公司也在培养自己的 " 小天才 ":速度快、有自己的判断、专注于特定领域,并根据实际工作持续调优。当更多公司拥有自己的智能,生态会更加繁荣,各自的特色也将得到充分发挥。
这就是企业拥有自有智能后,有望实现的未来。我们很高兴看到 " 小公司 " 不断进步,这些创业公司正努力让这样的世界成为现实。
原文:Own Your Intelligence: A How-To Guide
https://sequoiacap.com/article/own-your-intelligence-a-how-to-guide
请注意,本文编译自文末说明的原始链接,不代表 Z Potentials 立场。如果您对本文有任何想法或见解,欢迎在评论区留言互动探讨。
Z Potentials 将继续提供更多关于人工智能、机器人、全球化等领域的优质内容。我们诚邀对未来充满憧憬的您加入我们的社群,与我们共同分享、学习、成长。
特别声明:以上内容仅代表作者本人的观点或立场,不代表新浪财经头条的观点或立场。如因作品内容、版权或其他问题需要与新浪财经头条联系的,请于上述内容发布后的 30 天内进行。


登录后才可以发布评论哦
打开小程序可以发布评论哦