(本文作者为 AI 资本观,钛媒体经授权发布)
从 2023 年春天开始,中国科技圈几乎每隔一阵子就会冒出一个新的大模型。
发布会越来越多,模型的名字越来越多。有人看发布会演示,有人申请内测,也有人已经能通过 API 或者开发者工具试到其中一些能力。
但对大多数普通用户来说,它们仍然隔着一层。
不少产品仍停在邀请测试或有限开放。于是我们不断听说 " 大模型来了 ",却一直很难像打开一个普通网站或 App 那样,直接进去问一句。
这种情况,一直持续了几个月。
8 月底,几款此前还需要邀请资格或有限测试的国产生成式 AI 产品,开始直接向普通用户开放。
半年前,投资人一天看二十个项目时,许多团队还在组队、融资,真正把模型发布出来、开放测试的还不多。那时候,能把东西拿出来就已经算上了桌。
等大家陆续都上了桌,人们才发现:这些牌是不是有点多?而且打法也不一样。
这段 " 百模大战 " 却 " 见不得人 " 的故事,可以从 3 月 14 日开始讲。
01|模型走出实验室
2023 年 3 月 14 日,OpenAI 发布了 GPT-4。距离 ChatGPT 上线才三个多月。GPT-4 已经可以接收图像和文字输入,OpenAI 公布的多项专业测试成绩也明显高于 GPT-3.5。
也是在这一天,从 OpenAI 出走的达里奥 · 阿莫代伊,带领 Anthropic 团队结束早期小范围闭测,推出了其旗舰大模型助手 Claude 及轻量版 Claude Instant,正式迈入前沿大语言模型的公众竞争舞台。
中国这边,同一天发生的另一件事看上去小得多——清华和智谱团队在 GitHub 公开了 ChatGLM-6B 的模型文件和代码。
几个月前,GLM-130B 还是一个 1300 亿参数的大模型,团队曾经为训练发散和推理门槛吃过不少苦头。ChatGLM-6B 只有 62 亿参数,单看数字,它甚至像是在往回走。
但它的意义不一样。团队同时给出了训练好的模型文件、调用方式、Web Demo 和命令行 Demo。开发者可以把模型下载到本地运行,也可以围绕自己的任务继续调试和开发。

2023 年 3 月,ChatGLM-6B 开放权重和代码
这个首发版本还远谈不上 " 谁的电脑都能跑 ",默认版本大约需要 13GB 显存,许可证也仍然限定在非商业研究,但模型文件和代码真正到了开发者手里。
随后一周多里,更省显存的量化版本、API 部署和更省资源的微调方式陆续补进项目,外部开发者也开始提交新的网页 Demo 等工具,其中一个量化版本把显存需求压到大约 6GB。ChatGLM-6B 成为当年开发者最先 " 可以玩起来 " 的中国大模型之一。
接着动起来的是百度。2022 年底,李彦宏在百度内部已经说过," 这个事情很难,但百度必须要做 ",并启动了内部冲刺。
3 月 16 日,百度召开文心一言发布会,李彦宏走上台亲自介绍。但发布会上展示的文心一言几项核心能力,采用的都是提前录好的视频,而不是现场输入 Prompt 实时演示。
李彦宏自己测试过产品,也知道还有不少问题,他上台以后甚至直接承认:" 不能说百度完全准备好了。"
至于为什么不再等,百度给出的理由是 " 有市场需求 "。百度内部的产品线和合作伙伴都在等。李彦宏认为有了 " 真实的人类反馈 ",也能够帮助产品继续迭代。
发布会进行期间,百度股价一度跌了约 10%,后来收盘跌幅有所收窄。尽管股价变化很难只归到这一件事上,但外界当时对用录制的视频演示有不少讨论。
这一天之后,文心一言先进入邀请测试,少数用户可以通过邀请码体验,但真正向全社会全面开放还要再等五个多月。
02|" 距离 ChatGPT 发布,已经第 131 天了 "
也是在这一周,新一批创业者开始逐渐 " 上桌 ",其中声势最盛的,来自创新工场创始人李开复和前搜狗 CEO 王小川。
3 月 19 日,李开复公开宣布自己 " 正在亲自筹组 Project AI 2.0",并称 " 资金、算力陆续到位 "。
3 月 14 日一次创新工场活动上,他刚把这一轮变化称作 " 绝对不能错过的一次革命 ",几天后招聘已经开始,招聘方向包括大模型、多模态、NLP、算法研究和工程、分布式计算与 Infrastructure 等。
那时公司还没有后来定下的 " 零一万物 " 这个名字,但李开复已经把目标说得很大:一家面向全球的 AI 2.0 公司,既想做新的 AI 平台,也想做以 AI 为核心的生产力应用,而不是只做一个 " 中文版 ChatGPT"。
王小川的团队动作也很快。
4 月 10 日,北京海淀,搜狐网络大厦二层,王小川穿着一件橙色帽衫,走进一间不到 30 平方米的会议室。

2023 年 4 月 10 日,王小川首次公开介绍百川智能|图源:红星新闻
没有 PPT,他拿着一台 iPad 讲,楼上不时传来电钻声——楼上正在装修的,正是王慧文的新公司光年之外。他们几天前刚搬进来。
二月中旬,王小川回复外界追问时还在说 " 正在快速筹备中 "。现在,公司已经成立,名字叫百川智能。
公司主体在 3 月 24 日完成注册。4 月 10 日这天,王小川第一次公开亮相。当天公开信的开头,他先数了一遍时间:" 今天距离 ChatGPT 发布,已经第 131 天了。"
百川准备了 5000 万美元启动资金,一部分来自王小川个人,一部分来自好友个人支持。王小川说,这笔钱足够公司完成从 0 到 1,他也不希望一开始就背上太大的资本压力。
公司筹建还不到两个月。王小川当时预计,到 4 月底团队会接近 50 人,模型训练也已经启动。
王小川公开谈到的方向也不只是一款基础模型,还有搜索、多模态、教育、医疗,以及未来可能出现的超级应用。整个沟通会期间,楼上的电钻声仍不时响起。
03|百模大战," 像在炼丹 "
王小川公开亮相百川智能前后,大模型消息突然密了起来。
4 月 9 日,360 智脑开始面向企业用户开放内测。4 月 10 日,商汤发布 " 日日新 " 大模型体系,昆仑万维宣布 " 天工 "3.5。4 月 11 日,阿里正式展示通义千问,钉钉、天猫精灵将率先接入,阿里云还向企业开放测试,让客户可以用自己的数据做定制模型。
加上百川智能,同期媒体报道把这几天新大模型亮相概括成 "3 天 4 款 ",说 AI 赛道已经变得 " 熙熙攘攘 ",国产大模型进入了密集发布期。
再后面,4 月 13 日,知乎和面壁智能公布共同训练的中文大模型 " 知海图 AI",并开始尝试把它用于知乎热榜摘要;还有 5 月 6 日科大讯飞发布讯飞星火,把它接进学习机、办公和汽车等既有产品。
与这些 IT、互联网背景的公司不同的 " 异类 ",是来自量化投资行业的幻方—— 4 月 11 日宣布下场以后,一个多月里,它没有先发布产品。
直到 5 月 24 日,幻方创始人梁文锋第一次面向科技媒体 36 氪比较完整地解释他们准备怎么做。此时,新公司的名字已经出现:深度求索,DeepSeek。
梁文锋当时说,他们 " 不会过早设计基于模型的一些应用 ",准备先把精力放在大模型本身。他也谈到,VC 的钱有退出要求,会关心什么时候能够产品化、什么时候形成价值;如果先把很长时间花在基础研究上,双方的周期未必一致。
这种选择有一个重要前提:幻方已经有自己的资金、算力和技术团队,这是作为国内量化投资头部玩家的家底。梁文锋说,人不够时会从幻方临时借调;核心技术岗位里有不少应届或毕业一两年的年轻人,他更看重基础能力、创造性和兴趣。
梁文锋把这种条件说得很直白:
他顺手讲过幻方积累计算卡的过程:最初 1 张,后来 100 张、1000 张,再到 1 万张。至少在那次采访里,梁文锋谈得更多的仍然是研究,而不是先选一个行业做应用。
到了 5 月,零一万物成立。
它就是李开复 3 月公开筹组的 Project AI 2.0。李开复的身份也从投资人和孵化者,变成了这家新公司的创始人。
到这个时期,已经很难只盯着几家公司看了。
5 月 28 日,中关村论坛 " 人工智能大模型发展 " 平行论坛发布《中国人工智能大模型地图研究报告》。据不完全统计,当时中国已经发布 79 个 10 亿参数规模以上的大模型,相关团队分布在 14 个省市和地区,其中北京 38 个,广东 20 个。
这 79 个并不是 ChatGPT 出现以后几个月里突然造出来的,里面也包括此前几年已经启动、已经发布的研究成果。
报告甚至已经开始同时统计模型分布、人才、服务器采购和开源情况——到这一步," 百模大战 " 已经不只是发布会数量的问题。
论坛现场,一位参会者被记者问起这波大模型创业热时,先说 " 中国企业非常热情 ",随后又补了一句:
这当然是句黑话,说的是 GPU 算力像 " 炉火 ",训练模型的过程常常要靠反复实验和调参一点点试出来。
到了 6 月," 百模大战 " 已经直接出现在公开活动和新闻标题里。6 月 2 日,一场公开活动上,北京师范大学新闻传播学院院长张洪忠说," 国内现在是‘百模大战’ "。6 月 13 日,360 智脑正式发布时," 正式加入‘百模大战’ " 已经可以直接出现在权威新闻的标题里。
04|" 基础大模型其实不需要那么多 "
6 月 15 日,百川智能发布 Baichuan-7B,相关模型文件、配置和代码直接出现在 GitHub。当天就有外部开发者开始讨论怎样在 RTX 3090 这样的高端消费级显卡上继续微调它。
这时距离王小川手拿 iPad 在那间不到 30 平方米的会议室里说 " 模型训练已经启动 ",刚过两个月。
6 月 25 日,智谱升级发布 ChatGLM2-6B,距离第一代 3 月开放只有三个多月。
6 月 28 日,字节跳动旗下火山引擎发布火山方舟,把百川、MiniMax、智谱等多家模型接进同一个平台。有同期报道把它形容成一个 " 大模型商场 ",企业可以在里面选择和调用不同模型。
差不多就在这个时候,百度集团副总裁侯震宇公开说," 每一家企业是否都需要自己做一个大模型?我觉得不一定 ",给从业者的建议是 " 量力而行 "。
他还留下一句广为流传的话:
这并不能代表行业共识,新玩家上桌,老巨头迭代,大家都不肯落后。但至少到 6 月底," 是不是每家公司都需要自己训练基础模型 ",已经成了公开问题。
另一件值得记录的事是:6 月 29 日晚,美团发布公告,与光年之外签署收购协议,交易真正完成还要到 8 月。美团说,这笔交易希望获得 AGI 技术和人才,并表示会继续支持团队从事大模型研究。
几个月前,王慧文还写着 " 即便只有一个人,我也要出发 ";到 6 月底,光年之外已经组起大约 70 人的团队,但那个掀起半个科技圈热潮的 " 老王 " 自己,却因为身体原因暂时离开了一线。
到了 7 月,此前分散在各家公司发布会、产品和报道里的很多大模型,被摆进了同一个展馆——世界人工智能大会(WAIC)。
这届 WAIC 专门设置了 " 迈向通用人工智能 " 主题展区,30 多个大模型团队集中亮相。大厂、AI 公司、高校和创业团队的模型挨在一起,旁边还有算力、应用和基础设施。观众可以在 5 分钟之内纵览全国最新大模型,边看边对比;也有人逛到 " 脚都走麻了 "。阿里、百度、腾讯的展台几乎连在一起,形成 " 三连座 "。
大会结束后,又有记者写,大模型已经 " 随处可见,目不暇接 ",但整个展会走下来,很难说哪一个大模型应用留下了特别深刻的印象。
种种迹象表明,做出一个 " 聊得还不错 " 的大模型,似乎已经没有几个月前那么难,也不稀奇了。
由于普通用户这时候仍然难以直接用上各家模型,很难直观对比,到底哪家模型更强、彼此到底差在哪儿,是很多技术社区的热门话题。
05|不是每张牌都长得一样
WAIC 举行的同一周,7 月 7 日,华为云发布盘古大模型 3.0 和昇腾 AI 云服务。
和当时各家争相展示 " 会聊天、能作诗 " 的通用助手不同,华为拿出来的盘古,一看就不是给普通用户 " 玩 " 的产品。
华为云 CEO 张平安在现场说:
盘古 3.0 分成三层:基础大模型、行业大模型,再到具体的场景模型。华为当时列出的方向包括矿山、铁路、气象、药物研发。发布会上出现的是行业模型、场景模型、算力和云服务,并没有统一的聊天产品。

2023 年 7 月 7 日,张平安发布华为云盘古大模型 3.0|图源:华为云
两年前,田奇谈企业使用 AI 时,曾经用过从 " 作坊式 " 走向 " 工业化 " 的说法(详见中国大模型简史 01:模型越做越大,却没人知道它该变成什么)。到了 2023 年,这条路已经写进盘古 3.0 的产品结构里:把模型、算力、云和行业场景绑在一起。
另一批公司,交出的却是另一张完全不同的牌——它们把模型文件直接交到开发者手里。
几个月前,智谱已经把 ChatGLM-6B 的模型文件和代码公开。首发许可只限非商业研究;到了 7 月中旬,智谱又调整了 ChatGLM-6B 和 ChatGLM2-6B 的商用规则,企业按当时要求完成登记和授权后,也可以把它们用于商业项目。
行业里通常把这种做法叫 " 开放权重 ":不是多开一个网页入口,而是把训练好的模型文件提供给开发者,让他们自己下载、部署,再接进自己的应用。
这是美国 OpenAI、Anthropic 等闭源路线之外的另一种形态,构成了大模型实验室的另一条主流路线。
7 月 18 日,Facebook 母公司 Meta 发布 Llama 2。这是 Meta 当时新一代的大语言模型系列。几个月前的第一代 Llama 主要面向研究使用,Llama 2 则把预训练模型和对话模型的权重开放出来,允许更广泛的研究使用,也允许在许可范围内商用。
不到三周后,阿里也公开了自己的模型权重。
4 月第一次展示通义千问时,阿里先宣布让钉钉、天猫精灵接入,并通过阿里云向企业开放测试。8 月 3 日,阿里又把通义千问的 Qwen-7B 和 Qwen-7B-Chat 权重和代码公开给开发者,外部开发者也可以直接下载和部署。

2023 年 8 月 3 日,阿里 Qwen-7B / Qwen-7B-Chat 首次公开
模型越来越多,模型评测平台也不得不迭代。
2023 年夏天,OpenCompass 这个开源大模型评测平台持续把新模型加入评测范围。7 — 8 月,它不断增加新的 Benchmark(模型评测)、模型结果和模型对比功能。Qwen-7B 在 8 月 3 日发布后不久,也进入了它的评测范围。
今天回头看," 百模大战 " 这个词很容易让人产生一个错觉:仿佛 2023 年夏天,中国突然出现了一大批相似的大模型公司,大家只是拿着不同的模型参加同一场竞争。
事实没有那么整齐。
百度把模型做成面向用户的产品,并计划接进搜索等既有业务;华为把模型、算力、云和行业任务放在一起;智谱、Meta、阿里把模型权重交给公司之外的开发者;DeepSeek 仍愿意把更多时间花在基础模型研究上。
这些选择未来会影响产品、成本乃至战略,但在 2023 年夏天,很难说哪条路是唯一正确的。
但无论如何,经过数月喧嚣,大模型真正面向普通用户的门终于开始打开。
7 月 13 日,七部门公布《生成式人工智能服务管理暂行办法》,8 月 15 日起施行。
办法第二条写得很清楚:适用的是向中国境内公众提供生成文本、图片、音频、视频等内容的生成式 AI 服务。企业和科研机构如果只是研发和应用,没有向境内公众提供服务,则不适用。
8 月 31 日前后,第一批通过备案的生成式 AI 服务开始集中面向公众。百度当天宣布文心一言向全社会全面开放,智谱清言、百川等服务也在这一时期开始面向公众。
曾经在闲鱼上炒得火热的测试资格不再抢手。接下来,普通用户已经可以直接打开网页,开始提问。
|本章关键来源附录
OpenAI 关于 GPT-4 的官方研究材料;Anthropic 关于 Claude、Claude Instant 早期开放的官方材料;ChatGLM-6B、ChatGLM2-6B 官方 GitHub、Hugging Face 仓库及历史版本记录
百度 3 月 16 日文心一言发布材料、李彦宏相关公开表述,以及第一财经、彭博等对发布会和同期市场反应的报道
创新工场 Project AI 2.0 相关公开材料、零一万物官方资料;百川智能公开信、Baichuan-7B 官方仓库及王小川 4 月 10 日首次公开亮相的同期现场报道
36 氪旗下《暗涌 Waves》等对梁文锋、幻方与 DeepSeek 早期路线的同期访谈;幻方关于进入大模型领域的公开材料
知乎、面壁智能关于 " 知海图 AI" 的公开信息;《中国人工智能大模型地图研究报告》及 2023 年 5 — 6 月 " 百模大战 " 相关同期报道
世界人工智能大会官方材料,以及第一财经等对 2023 年 WAIC 大模型展区、" 三连座 "" 像在炼丹 " 等现场的同期报道
火山引擎关于火山方舟的发布材料;美团 6 月 29 日港交所收购公告及相关公开资料
华为云关于盘古大模型 3.0、昇腾 AI 云服务的官方材料;Meta 关于 Llama 2 的官方发布与许可证;Qwen 官方仓库历史记录;OpenCompass News / Changelog
国家网信办《生成式人工智能服务管理暂行办法》及生成式 AI 服务备案相关公开材料;百度、智谱、百川等关于 8 月 31 日前后面向公众开放的官方信息
更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体 App


登录后才可以发布评论哦
打开小程序可以发布评论哦