Ping值焦虑 1小时前
字节拟训练超5万亿参数大模型,张一鸣罕见发声:反对蒸馏
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_caijing1.html

 

8 月 10 日一早,A 股打新页面里," 人形机器人第一股 " 宇树科技(688836)的申购按钮正式亮起。发行价 150.80 元 / 股,上市市值约 609.99 亿元,远超市场此前预估的超 400 亿元。社交平台上,不少投资者晒出申购截图排队 " 许愿求中签 "。同一周,AI 圈没有闲下来:字节跳动被曝正在讨论训练参数规模超 5 万亿的新模型,创始人张一鸣在内部会上罕见发声;DeepSeek 一边宣布 API 要涨价,一边被网友扒出创始人梁文锋早年的微博账号;DeepMind 两大核心人物的去留问题,也在这个 8 月迎来关键转折。

一、字节的 "5 万亿参数 " 豪赌:一次推到同行数倍

8 月 6 日消息,据媒体报道,字节跳动正在讨论训练一个参数规模超 5 万亿的模型。这个数字放在当前的国内大模型版图里是什么概念?报道给出了两个参照物:阿里的 Qwen3.8-Max 是 2.4 万亿参数,月之暗面的 K3 是 2.8 万亿参数。也就是说,字节这个还在讨论中的新模型,参数规模将是已知同行的两倍上下,也是目前国内已知参数规模最大的模型。

不过,这条消息带了一个非常重要的限定条件:该计划仍处于早期阶段,模型最终不一定会发布。换句话说,这更像是 Seed 团队在技术路线上的一次方向性表态,而不是一个已经落地、板上钉钉的产品排期。

报道称,这个新模型将由 Seed Foundation 负责人项亮主导,与大语言模型预训练数据负责人沈科合作。两人都是字节跳动人工智能及大模型研发体系内的核心骨干,而且都有同一个出处:字节的 " 搜广推 " 体系。项亮本科毕业于中国科学技术大学,博士就读于中科院自动化所,2016 年加入字节,曾负责机器学习中台 AML 团队,后来调任豆包大模型 Foundation 团队负责人。沈科 2018 年从清华毕业后加入字节跳动,目前主要负责大语言模型预训练数据。

一位接近 Seed 的人士向媒体解释了字节为什么要往这个方向走:与其在现有尺寸上继续追赶其他大模型,不如把参数规模一次推到同行的数倍,争取一个领先位置。这个逻辑很直白——不在同一个维度上和对手拼迭代速度,而是直接换一个量级重新定义赛道。

二、张一鸣罕见发声:可接受暂时落后,反对蒸馏

就在这个消息被曝出的两周前,字节跳动创始人张一鸣刚刚在 Seed 全员会上做过一次安抚。据与会者转述,张一鸣认为训大模型本就是一件很难的事,团队不必过度焦虑。他明确表示,一段时间内可以接受模型落后于行业,希望大家把追求智能上限作为目标,期待 Seed 的模型能力能跻身世界第一梯队。

这算是张一鸣罕见地在内部场合正面评价大模型竞赛的节奏问题。外界习惯用 " 落后 "" 追赶 "" 超越 " 来给大模型公司排名,但张一鸣给团队定的调子是:可以接受暂时落后,但不能放弃上限。

更值得琢磨的是他对技术路线的态度。张一鸣认为编程是当前的关键方向,并表态自己反对蒸馏。在张一鸣看来,蒸馏能在短期内改善模型表现,但本质上仍是在复制 Claude 已有的能力。沿着这条路走,最多只能不断逼近对方,很难真正实现超越。

这句话的信息量不小。蒸馏是当前大模型行业里常见的 " 提效 " 手段——用一个强模型(比如 Claude)的输出训练另一个模型,让新模型在数学、编程等能力上快速接近那个强模型。张一鸣反对的并不是蒸馏这个技术动作本身,而是把蒸馏当作核心策略的路径依赖:一旦

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

张一鸣 字节跳动 创始人 a股 中科院自动化所
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论