老陈啊老陈 9小时前
字节 5 万亿参数豪赌背后:国产大模型正式进入“底层突围”阶段
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

8 月 6 日,《晚点 LatePost》独家披露,字节跳动正在讨论训练一个参数规模超 5 万亿的超大基础模型,由 Seed Foundation 负责人项亮主导,与大语言模型预训练数据负责人沈科合作推进 。该项目目前仍处于早期论证阶段,不代表最终一定会发布,但它是目前国内已知参数规模最大的模型规划 。

这一动作的背后,是国产大模型参数竞赛进入新阶段的标志性事件,更是字节在 AI 战略上的一次根本性转向。

一、参数竞赛:从 " 万亿 " 到 " 五万亿 " 的跨越

把时间线拉清楚,2026 年国产大模型的参数规模经历了阶梯式跃升:

4 月:DeepSeek 发布 V4-Pro,总参数 1.6 万亿

7 月 16 日:月之暗面发布 Kimi K3,总参数 2.8 万亿,激活参数 1040 亿,成为首个接近 3 万亿参数的开放权重模型

7 月 19 日:阿里发布 Qwen3.8-Max-Preview,总参数 2.4 万亿

8 月 6 日:字节被曝讨论训练超 5 万亿参数模型

中信建投在最新研报中指出:" 前沿模型能力提升已进入多路径并行阶段,Pre-training Scaling 并未结束,海外头部模型率先进入多万亿参数区间,国内 Kimi K3、Qwen3.8 等模型快速跟进,字节跳动最高 10 万亿参数模型亦在预训练 " 。

这意味着,国产大模型参数竞赛的下一站,是 5 万亿甚至 10 万亿。字节的动作不是孤例,而是这场竞赛的阶段性高点。

二、张一鸣的战略转向:拒绝蒸馏,追求智能上限

此次曝光的最大看点,不是参数数字,而是张一鸣在 Seed 全员会上的表态 。

核心信号一:明确拒绝 " 蒸馏 " 捷径

所谓蒸馏,是将别家大模型已有的能力 " 借鉴 " 过来,是最快的追赶方式。但蒸馏的本质是复刻,只能无限逼近对手,永远无法实现超越 。

张一鸣的选择是:哪怕短期落后,也要从预训练开始自己跑一遍

核心信号二:可接受一段时间落后

" 一段时间内可接受模型落后于行业,希望大家以追求智能上限为目标。" 这句话在 AI 圈极为罕见——大多数公司恨不得季度财报上就要看到模型排名上升。

核心信号三:豆包战略地位升级

梁汝波把 " 豆包 " 和 " 抖音 " 放在了同等战略权重 。这不是一句口号,而是资源分配的根本性调整。

一位接近 Seed 人士的评价一针见血:" 像一场赌博。"

三、算力账:5 万亿参数的真实门槛

训练 5 万亿参数模型,算力需求达到前所未有的量级。业内基于 H100 高端显卡的测算 :

10 万张 H100:不间断训练需 347 天

100 万张显卡:压缩至 35 天,但跨进 GW 级算力规模

20-30 万张(字节可行方案):预训练 3-4 个月

叠加数据清洗、微调、安全对齐等配套流程,整套工程落地至少需要半年到一年

OpenAI:约 200 万张显卡(SemiAnalysis 测算)

Anthropic:约 62 万张显卡

字节:财力充足,但需在短时间内凑齐几十万张高端显卡

百万卡集群不仅是钱的问题,更是电力、散热、集群稳定性、网络通信的世界级工程挑战。字节要在合理时间内落实训练,考验的是综合工程能力而非单纯资金实力。

四、字节的 " 偏科 " 焦虑:为什么要补课?

理解字节此举,必须看清其在大语言模型赛道的真实处境。

多模态领跑,语言模型追赶:

过去两年,字节 Seed 在多模态领域堪称行业领跑者—— Seedance 视频生成、Seedream 图像生成成为火山引擎 MaaS 业务的核心营收支柱 。但在核心的大语言模型赛道,字节却陷入了被动 :

❌ 智谱 GLM-5、Kimi K3 在代码编程、复杂逻辑推理、长文本处理上全面超越字节 Seed 2.0

❌ 火山引擎 MaaS 核心营收几乎全部来自多模态,语言模型 token 消耗和商业贡献占比极低

❌ 竞品凭代码和通用推理能力,拿下政企、研发类 B 端刚需市场,营收结构更健康

多模态的优势无法弥补通用大模型的短板。通用语言模型是所有 AI 应用的底座,是抢占企业服务、智能开发市场的核心关键 。

与其在现有千亿、万亿参数模型上持续微调、被动追赶,不如一次性把参数规模拉到同行的数倍,用极致资源投入实现弯道超车。

五、商业回报:唯一未解的悬念

技术上的豪赌,最终要接受商业的审判。

中信建投在研报中明确指出:" 阿里等头部厂商持续扩大模型规模、强化 Agent 能力,而 DeepSeek 逐步转向提价,反映国产大模型逐渐进入 ' 能力提升商业变现 ' 阶段 " 。

但 5 万亿参数模型的投入规模,对商业回报提出了极高要求:

需要通过订阅服务、API 调用、企业授权等途径收回成本

国内大模型价格战已打到尾声,单纯追求技术领先无法持续

梁汝波自己强调:" 这只是一个研究方向,距离真正可用还很远 "

⚠️ 字节必须在技术突破与商业变现之间找到平衡点。一味追求技术领先而忽视盈利,持续的投入将面临巨大压力。

六、产业启示:国产大模型的 " 底层突围 "

字节 5 万亿参数模型的讨论,揭示了国产 AI 发展的三个关键趋势:

趋势一:Pre-training Scaling 远未结束

海外头部模型率先进入多万亿参数区间,国内 Kimi K3、Qwen3.8 等快速跟进,字节最高 10 万亿参数模型亦在预训练 。参数竞赛进入新阶段。

趋势二:从 " 应用创新 " 到 " 底层原创 "

过去国产大模型大多走 " 轻量化、快落地、重应用 " 路线,追求短期商业回报。字节此次放弃捷径、深耕超大参数原生预训练,是向 AI 技术最底层发起的冲击 。

趋势三:商业化能力成为分水岭

中信建投指出,国产大模型正进入 " 能力提升商业变现 " 阶段 。未来,谁能将超大参数转化为可持续的商业回报,谁就能在下一轮竞争中胜出。

核心判断:字节的 5 万亿参数豪赌,本质上是国产大模型从 " 应用层内卷 " 转向 " 底层突围 " 的标志性事件。张一鸣用 " 不蒸馏 " 三个字,宣告了字节愿意用短期落后换长期领先的赌约。这场豪赌的终局,不仅关乎豆包能否摆脱 " 智商调侃 ",更关乎国产大模型能否在全球 AI 竞争中真正跻身第一梯队。

2027 年,当这个模型真正面世时,我们会看到答案。

# 人工智能未来 #

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论