(本文作者为 硅谷 101,钛媒体经授权发布)
8 月 13 日凌晨,DeepSeek V4 Pro 正式登场,给开源模型生态又添一把猛火。从 Kimi K3 到 MiniMax H3,再到 DeepSeek V4 flash、DeepSeek V4 Pro,在中国开源模型的猛攻之下,美国的 AI 公司这次是真的坐不住了。
黄仁勋亲自下场发表了人生第一条推文,呼吁全行业共同推动美国开源生态的发展。目前,这个联盟除了 Anthropic 之外,美国 AI 圈的主要玩家几乎全员到齐,Sam Altman、Sundar Pichai 等闭源模型掌门人也都罕见发文表示支持。
为什么这些平时斗得最厉害的公司,这次却罕见地站到了同一战线?而 Anthropic 坚持不加入的原因又是什么?
要回答这个问题,我们得先搞明白一个更基础的事情,那就是今天 AI 行业所说的 " 开源模型 " 到底是什么?以及模型开源之后,对于模型厂商以及整个行业又意味着什么?
很多人会觉得,一个 AI 模型就是一套代码,所谓 " 开源 ",就是把代码发布出去,但其实并不是。要理解模型到底开放了什么,我们首先需要捋一遍一个大模型从训练到最终发布的完整流程。
这个过程大致可以拆成七个部分。
第一,训练数据。研发团队首先要决定使用什么数据训练模型,比如网页、书籍、代码,以及不同类型数据如何配比,再经过清洗和筛选。这一步,决定了模型的 " 底子 " 好不好。
第二,模型架构和参数规模。这个阶段主要进行模型规划和设计,包括采用什么模型架构、参数规模有多大,以及各种训练配置。这些设计,决定了模型的能力上限和训练效率。
需要注意的是,参数规模并不是指训练数据的大小。训练一个模型,本质上是在不断地做 " 调整 ",而参数规模说的是 " 这次总共要调整多少个地方 "。参数规模越大,模型能捕捉和处理的细节、规律也越复杂。
第三,训练基础设施。模型设计完成后,需要庞大的算力来完成训练,包括 GPU 集群、高速网络、存储系统以及各种训练框架。而如何把这些算力高效组织起来,正是如今最火的 AI Infra(人工智能基础设施)领域。像 DeepSeek 的 DeepGEMM、Kimi K3 的 FlashKDA、MoonEP,都属于这一层的创新。
数据、架构和基础设施准备完成后,才进入真正的训练阶段。
第四,训练流程和 Checkpoint。在这个阶段,模型会进行预训练、微调和强化学习,在训练过程中,也会不断 " 存档 ",方便继续训练、测试或回滚。
第五," 模型权重 "。经过漫长的训练之后,模型内部数十亿甚至数万亿个参数都会被逐步调整到合适的数值。这些参数最终形成的集合,就是 " 模型权重 ",也是整个模型最核心的成果,记录着模型在训练过程中学到的知识和能力。
第六,模型部署。训练完成后,还需要将权重部署到服务器,通过 API 或者本地部署的方式,真正提供给开发者和企业使用。
最后," 技术报告 "。这些流程结束之后,模型厂商们通常还会写一个 " 技术报告 "。里面会介绍模型架构设计的思路、数据大致的构成、训练中踩过的坑和最终的评测结果等内容,让外界理解这个模型是怎么做出来的。但技术报告不是可以照着复现的操作步骤,它讲的更多是一种方法论。
清楚了训练流程之后,那么 " 开源 " 具体是指开放的什么环节呢?按照模型的开放程度,现在主要分为闭源、开放权重和完全开源这三大类型,我们先说两端。
闭源模型很好理解,就是以上环节全部都不对外开放,客户只能在模型部署层面通过 API 或具体产品使用模型能力。Anthropic、OpenAI 和谷歌目前的大部分模型都是这种形式。
完全开源的模型叫 Open Source,是指从训练数据、训练代码到中间存档、技术报告都完全公开。Ai2 (艾伦人工智能研究所)推出的 OLMo 系列,就是这样的代表。
但现在说的大部分的开源模型,其实都不是真正的 Open Source,而是位于开源和闭源中间地带的 Open Weight(开放权重)。相当于只是送出了模型训练的最后结果,大家可以直接拿去用,也可以在结果之上进行微调和改进。
但现在不同的开放权重模型之间,开放的程度也存在很大差异,我们用几个比较具有代表性的模型来具体说明一下。
首先," 模型权重 " 严格来说只是一个巨大的数字文件,光靠它并不能直接运行。如果从 Hugging Face 上直接下载 Kimi K3 的权重,得到的是约 2.8 万亿个浮点数,按照模型架构规定的顺序,整齐排列在其中。
所以,除了权重本身,厂商通常还会公开一份推理代码,专门负责教用户如何读取权重文件、按照什么顺序进行计算,以及最后怎么把结果变成一句话回复用户。
最基础的 " 开放权重 ",就是把模型权重以及这个能跑、能微调的推理代码公布出来,让任何人都可以把模型下载到自己的服务器上运行。其中最具代表性的,就是 Meta 的 Llama 系列。
但训练数据的具体配方、训练过程中不断调整的策略,以及支撑整个模型训练的内部工具链,这些更核心的部分,Meta 始终没有开放。
此前,从 Llama 1 到 Llama 3,Meta 还会发布较为详细的技术报告,分享模型设计和工程经验。但到了去年的 Llama 4,Meta 只发布了一篇简短的博客,没有再公开完整的技术报告,开放的程度也变得更加保守。
而 DeepSeek 之所以震撼整个行业,其中一个重要原因就在于,它不只是把方法详细地讲了出来,甚至还把内部的工程工具链本身开源了,可以说是 "Open Weights" 的 Plus 版本。
在此之前,大部分模型厂商的技术报告更像是公关稿,通常会告诉大家模型有多少参数、在哪些 Benchmark(基准测试)上取得了什么成绩,却很少解释这些成绩是怎么做出来的。
但 DeepSeek V3 和 DeepSeek-R1 却把过去一些很少公开的研发细节,几乎毫无保留地写了出来。比如,它详细介绍了 MoE(混合专家)模型是如何设计的、为什么要采用 Multi-head Latent Attention(MLA)来降低 KV Cache 的内存占用、FP8 训练是如何稳定实现的,以及不同方案之间,为什么最终选择了现在的设计、放弃了其他路线。
除了技术报告,DeepSeek 还陆续开源了 DeepEP、FlashMLA 等训练和推理基础设施组件,把很多过去只属于内部工程团队的工程经验,也变成了整个行业都可以使用的工具。
可以说,DeepSeek 开启了一种新的模型开放形式,而此次 Kimi K3 也延续了这种做法。
除了公布非常详细的技术报告,介绍模型架构、训练方法和大量工程细节,Kimi K3 此次还同步开放了三大自研底层基础设施。其中包括解决 MoE(混合专家)模型里几百个 " 专家 " 之间通信效率的 MoonEP,加快注意力计算的 FlashKDA,以及给智能体训练搭建可运行的环境的 AgentEnv。
这三项分别对应训练大模型时会遇到的三个卡点:通信、计算、训练环境,也让大家能更了解 Kimi 团队是怎么高效训练出这个模型的。
不过,在目前整个训练环节中,大多数开放权重模型真正公开的,其实只有模型权重、推理代码,以及一部分技术报告和基础设施工具。而训练数据和完整训练流程,仍然是各家最核心的商业机密。
而且,开放权重也并不意味着毫无限制。真正决定开发者能不能将模型商用、修改以及再发布的,是模型附带的许可证(License)。
过去一年,一个很明显的趋势是,中国大部分模型厂商的许可证正在变得越来越开放。
比如,DeepSeek 最早发布模型时采用的是自己制定的协议,对使用场景还有一些限制。但到了 DeepSeek-V3 和 R1,已经全面切换到了 MIT License。这意味着,只要保留版权声明,开发者几乎可以自由下载、修改、商用,限制非常少。
阿里的 Qwen 也走了一条类似的路线。从最初采用阿里自定义协议,到后来切换为国际上广泛使用的 Apache 2.0 许可证,同样大幅降低了商业使用门槛。值得注意的是,此前 Qwen 的旗舰 Max 系列一直是保持闭源、只能走 API,但在这个月初,阿里表态,将首次把旗舰模型 Qwen3.8-Max 的权重开源。
智谱 GLM 也是一样,他们从 2025 年的 GLM-4-0414 开始使用 MIT License,后来一直沿用至今,商业使用限制很宽松。
当然,也并不是所有公司都会选择 " 完全放开 "。 Kimi 之前的 K2 系列用的是一种叫 Modified MIT 的许可证。但这次 K3 启用了一份全新的,叫做 Kimi K3 License 的协议,不再自称是 MIT 的修改版。
对绝大多数开发者和中小企业来说,其实实际使用体验和 MIT 差别不大,因为都是免费下载、商用和修改。但它加了两道门槛:一是产品月活超过 1 亿或者月收入超过 2000 万美元的,需要在界面上显著展示 "Kimi K3" 标识;第二,如果做的是模型即服务的托管生意,且连续 12 个月总收入超过 2000 万美元,就必须先和月之暗面另行签署商业协议才能商用。
而限制最多的,则是 Meta 的 Llama。它没有采用 MIT、Apache 这些主流开源许可证,而是自己制定了一个 Llama Community License,中间的限制非常多,例如月活用户超过 7 亿的产品需要额外申请授权,部分版本曾限制在欧盟地区使用,同时协议还明确禁止开发者利用 Llama 的输出去训练其他大型模型等等。
不过 Meta 近期也在重回开放路线,它们最新发布了 300 亿参数的开放权重模型 Muse Glimmer,就采用了 Apache 2.0 许可证。此外扎克伯格还宣布,Meta 目前最强基础模型 Muse Spark 1.2 也即将开放权重。
王铁震
前 Hugging Face 亚太生态负责人
把这些东西写清楚之后,很多专门做模型推理和云服务的厂商实际上就没有办法 take free ride(不劳而获)。过去一些开源项目,包括开源数据库,最担心的就是云厂商没有出工、没有出力,却可以直接把开源项目部署到自己的云上赚钱。所以,这种不劳而获,一直是开源社区想要避免的。
当然,许可证只是划定了红线,并不能把模型变成收入。那么,这些开源模型的公司靠什么赚钱呢?
实际上,开放权重并不等于放弃商业化。企业下载模型只是第一步,要真正把模型稳定部署到生产环境,还需要算力、运维、持续更新以及针对业务场景的定制开发等等。相比自己组建团队,很多企业依然会选择直接购买模型公司的 API 服务、企业版部署或行业解决方案。
因此,开放模型可以带动一整套围绕模型的服务收入。
第一种,是通过开放模型带动云计算和基础设施消费。
以千问为例,模型权重虽然可以免费下载,但企业想要大规模部署,依然需要 GPU、云存储、网络、数据库和模型管理平台。对于阿里这样的云厂商来说,开放模型更像是一个入口:模型本身可以免费,但运行模型所需要的整套云服务都是收费的。
第二种,是为企业提供部署和定制服务。
很多金融、医疗、政府或大型企业不希望把内部数据发送给外部 API,而是希望把模型部署在自己的服务器或私有云里。但下载权重之后,企业还需要完成模型适配、数据清洗、安全评测、推理优化和后续维护。
模型公司可以向这些客户出售私有化部署、行业微调、技术支持和长期维护服务。
第三种,则是提供收费的后训练和模型开发平台。
现在的企业更希望在现有开放模型的基础上,加入自己的数据和业务规则,把它变成更适合特定任务的专用模型。模型公司可以提供微调、强化学习、评测、数据管理和版本管理等工具,并按照训练算力、使用量或企业订阅收费。像 Thinking Machines 的思路,就更接近这种。
Keith Zhai
TinyFish 联合创始人
关于 AI,一个核心问题是,intelligence(智能)到底应该是我租借来的,还是应该真正变成自己的。而整个的大背景是,越来越多企业正在接受这样一种观点:智能应该为我所有,而不应该是租借。
以 Kimi 为例,虽然模型权重已经开放,但它们依然提供付费订阅、API 调用以及企业级 AI 服务。
除此之外,开源模型厂商的另一部分收入来源,是提供模型服务的 MaaS(Model as a Service)厂商和云厂商。
MaaS 厂,包括最近很火的 Together AI、Fireworks AI 等等,是把开放权重模型部署到自己的 GPU 集群上,再通过 API 提供给开发者使用。云厂商,也就是大家熟悉的卖基础设施的 AWS、阿里云等等,现在也会卖模型服务。在 K3 这样的许可证下,这类厂商也要向 Kimi 交钱。
公开信息显示,Moonshot AI 当前的年化经常性收入(ARR)已经达到约 3 亿美元。
一个反常识的观点是,云厂商和 MaaS 厂实际上应该非常欢迎 Kimi 来找他们收钱。因为只要 Kimi 收钱,就意味着你和 Kimi 存在官方认证关系,包括你卖的 token 质量等等,都是有官方给你做保证和背书的。Kimi 官方还发布了一套 vendor verification(供应商验证)流程,有点像 "Intel Inside(英特尔商标)"。只有通过验证的流程,卖出来的 token 才能被证明是好的,包括准确性和性能都是有保障的。对消费者来说,也更容易知道应该购买谁的 token。
所以,开放权重并不意味着商业价值的消失,更多的是一种商业模式的变化。而对于整个 AI 生态来说,它也有着非常重要的价值。
过去几年,Claude、ChatGPT、Gemini 这些业界最强的模型几乎都是闭源的,但这些模型能力始终牢牢掌握在少数几家公司手里。
而开放权重,则让拥有前沿能力的 AI 模型可以像软件一样,被下载、部署、微调,并在此基础上继续创新。
对于企业用户来说,这绝对是件天大的好事。
首先是成本。还记得今年年初编程 Agent 开始流行,每家企业都开始 token maxxing 的几个月吗?这一通操作下来,每家公司都发现自己的 token 账单水涨船高。在这样的背景下,开源模型显然成了最优解。毕竟,中国开源模型能力已经能追平最强闭源模型,又很便宜,还能自己调整,谁不爱呢?
而现在一种主流的企业做法就是:最困难的任务还是使用几家能力最强的闭源模型,日常的任务就都通过中国的这些开放权重模型来实现。
其次,是所有权问题。
如果模型的一切都取决于对方是否开放,就像 Fable 今年早一点的事情,对大家影响很大的。突然有一天,美国商务部说不可以用了,那就一夜之间就都不可以用了,之前做的部署可能都没有了,那这种情况怎么办?
这就是为什么对于企业来说,在能力几乎相当的情况下,开放模型有绝对的优势了。而对于普通开发者来说,开放权重也大大降低了参与模型创新的门槛。
以前开发者想要基于 GPT 或者 Claude 开发产品,能做的事情其实很有限。但借助权重和技术报告,开发者就能够自己去尝试修改模型、继续训练模型,甚至让模型适配完全不同的场景。
而且现在 vLLM 和 SGLang 等开源推理引擎都能够对大部分开源模型做到 Day-0 支持,这也意味着开发者们不需要自己解决复杂的推理部署问题,就能直接部署模型。
如今,开放权重模型已经成为大量 AI Agent、机器人等项目的重要基础,推动着整个 AI 创业生态的繁荣。
此外,开放权重本身也在加速着模型的迭代。比如在 Kimi K3 的技术报告里,有一部分专门介绍了他们如何优化 MoE(混合专家)模型中的负载均衡,而这套方法就是他们在 DeepSeek V3 方案基础上的继续演进。
闭源模型的技术突破,很可能永远留在自己的服务器里。但借助于开放的技术经验,整个行业就能够站在巨人的肩膀上加速往前走。
所以无论是从商业、还是整个 AI 生态的角度,开放权重都正在成为非常重要的一条技术路线。这也是为什么此次黄仁勋会牵头来做这件事,并且一呼百应。
最近针对中国开源模型的强势崛起,有消息传出美国政府正在考虑采取相关限制行动。
" 开放安全 AI 联盟 " 的核心观点是,美国既需要最先进的闭源模型,也需要最先进的开放模型。他们认为,开源模型对网络安全和 AI 创新、AI 主权都至关重要。监管应该针对具体风险,而不是因为安全担忧,就限制开放权重这种技术路线本身。
但这个联盟背后也有着更深的商业考量。比如对于微软、亚马逊、谷歌这几个大型云厂商来说,不管客户最终部署的是 OpenAI、Llama、DeepSeek 还是 Kimi,只要运行在云上,它都能够从中获益。
对于英伟达、AMD、Baseten 这样的基础设施企业来说,开放权重意味着会有更多企业、开发者和国家,把模型部署到自己的服务器。而每一次部署、微调和推理,都会带来新的算力需求。不少基础设施公司的业务增长,甚至就是伴随着一代代开源模型而发展壮大。
(英伟达)从芯片、基础设施的角度看,它肯定是所有人,每个人都能自由搭建一个模型最好。因为它并不在乎这个谁能挖到金子,重要的就是它能卖更多的铲子。
而对于像 Palantir、Databricks 这样的企业软件和 AI 应用公司来说,它们卖的本来就是模型之上的数据平台、AI 应用和行业解决方案。模型越开放,它们能够服务的客户和场景反而越多。
目前,这个联盟名单几乎聚齐了美国所有主要 AI 公司的名字,但唯独少了 Anthropic,它们为此也专门发了一篇长文来阐明立场。
Anthropic 首先表态它们从来没有主张过禁止开放权重模型,但它们担心两件事: 一是前沿开放模型带来的安全风险。在闭源的情况下,一些危险的 AI 能力还被掌握在少数模型公司手里,但如果最强大的模型权重被公开,任何人都可以下载、部署、修改,那么恶意使用这些能力的门槛也会随之降低,这将让整个世界都处于危险之中。
第二是蒸馏问题。它认为中国的开源模型之所以发展的这么快,就是大规模地蒸馏了美国最前沿的这些闭源模型,进而也会大幅降低追赶最前沿模型所需要的算力。与其纠结要不要管开源,美国政府更应该先管管 " 蒸馏 "。
但很多人认为,Anthropic 之所以坚持不开源,更多的也是出于商业利益的考虑。
对于闭源模型公司来说,开放权重无疑是会严重冲击它们的商业模式。因为一旦越来越多高性能的开放模型出现,企业就有了更多本地部署和自主定制的选择,对闭源 API 的依赖也会降低。而模型能力本身也更容易被快速追赶和复制,让闭源模型赖以建立的竞争壁垒受到挑战。
而最近,在美国全行业越来越强的开源声势下,Anthropic 坚持闭源的立场现在正在遭受着越来越大的压力,对它 AI 安全立场的质疑声也逐渐变大。
但是我们也看到,并不是所有人都反对 Anthropic 的这些观点。比如本次 Kimi K3 开源之后,网上就出现了不少声音,认为把这样已经达到最前沿能力的模型开放出来,本身就是一种风险。
最近,OpenAI 和 Anthropic 的模型接连曝出越狱攻击事件,让这种担忧进一步升温。因为即便是部署在官方服务器、拥有持续监控和安全更新能力的闭源模型,目前看来也并非绝对安全。
而如果未来,越来越多能力接近 Fable 5 这一水平的开放权重模型被部署到成千上万家企业、本地服务器甚至个人设备上,情况就会变得更加复杂,模型治理、安全更新和风险控制必然将面临更大的挑战。
目前业界关于开源模型的讨论还在激烈的进行着,但无论如何,开放权重已经成为推动这一轮 AI 发展的重要力量。它降低了技术门槛,加快了创新速度,也让越来越多企业和开发者有机会参与到 AI 生态中。
但与此同时,它确实可能也会带来新的问题和风险。接下来,我们也会持续追踪中美开源模型的发展,以及它对整个 AI 产业的影响。
更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体 App


登录后才可以发布评论哦
打开小程序可以发布评论哦