无相商业趋势 20小时前
张一鸣按下“蒸馏”暂停键:字节宁可落后,也不抄别人答案
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

上个月,一向低调的张一鸣做了一件很罕见的事。

面对 Seed 团队内部持续一年多的 " 要不要蒸馏 " 争论,他给到了定调:

" 字节跳动应该愿意为更长期的目标,牺牲一些短期收益。"

据《The Information》披露,张一鸣明确表态:闭源模型不能蒸馏,开放权重模型也不能蒸馏。"Seed 可以接受暂时的落后,但不接受依靠蒸馏竞争对手来消除这种落后。"

一句话,把字节 AI 团队想 " 抄答案 " 的路,给堵死了。

现在人人都喜欢说抄答案,可为什么字节不抄?

要理解张一鸣这个决策的分量,可能要先搞清楚 " 蒸馏 " 是怎么回事。

模型蒸馏(Knowledge Distillation)的概念类似让一个小模型(学生)去模仿一个大模型(教师)的输出概率分布,从而用非常小的代价和训练,去获得接近教师的能力。

提出这个模式的,是人工智能之父辛顿,他在 2015 年发表了相关论文,后来 Google、OpenAI、Anthropic 等大厂在做轻量版模型时也会使用蒸馏,完全合法。

不过,现在有一个不好的风气,很多 AI 大模型企业,不是蒸馏自己的模型,而是蒸馏竞争对手的模型,甚至是闭源模型,性质就变了。

抄自己过去的答案叫改进,抄别人的答案,那就真是抄袭了。

那么,这些模型厂商是怎么抄袭的呢?

首先,批量构造几百万个问题,然后扔给 Claude/GPT 这类头部模型,收集它们的回答。

这些回答里往往会带上推理路径、判断逻辑、表达策略,然后收集这些数据,用于训练自己的模型。

相当于用几个小时,就学会了别人十年的功夫。

省掉的不仅是算力,还有数据制作、强化学习、试错的全部成本。

2026 年 2 月,Anthropic 公开指控 DeepSeek、MiniMax、月之暗面用超过 24000 个虚假账号、对 Claude 进行了总计超 1600 万次对话交互,通过蒸馏大规模提取其核心能力。

在控诉中,Anthropic 详细描述了这些企业的 " 九头蛇架构 " ——用分布式架构将恶意流量伪装成正常请求,系统性地提取 Claude 的推理能力、工具调用与编程数据,其中 MiniMax 交互超 1300 万次,月之暗面超 340 万次,DeepSeek 超 15 万次。

这份名单里,没有字节跳动的 Seed。

这个细节,很关键。

Seed 团队关于蒸馏的争论,在过去一年至少爆发了三次:

第一次,是 2025 年 1 月 DeepSeek-R1 发布后。

当时 DeepSeek 掀起了一阵科技自信潮,但内行人知道,DeepSeek 用了一种很投机的方式——蒸馏。

这个方法被其他大模型企业知道后,字节内部的部分研究员也跃跃欲试,提议引入美国头部闭源模型生成结果,快速提升推理与综合表现。

但提议被否决。

第二次,是 2025 年底至 2026 年初,英伟达 Blackwell 系列 GPU 在美国大规模商用阶段。

受美国高端 GPU 出口管制影响,Seed 训练所用的 H20 算力仅为 B200 的五十分之一。

显卡不足,算力就不够,算力不够,大模型就没有别人聪明,这个时候,字节内部又有人提出 " 实在不行就蒸馏 ",这个动议获得较多支持,仍未获得张一鸣的批准。

第三次,是 Kimi K3 成功发布后。

7 月 16 日,月之暗面推出 Kimi K3,官方称其拥有 2.8 万亿参数、原生视觉能力和 100 万 token 上下文的开放模型,是地表 " 最强开源模型 ",进入全球第一阵营。

相反,投入更大、人才更多的 Seed 却没有推出同级语言模型。

此时,蒸馏提议再度高涨:行业都在抄,抄袭的比用功努力的效果好多了,为什么我们不抄?如果怕法律制裁,那我们就蒸馏开源的模型不就行了吗?

在部分字节员工看来,公司不愿采用蒸馏,是其大语言模型落后于阿里巴巴,以及 DeepSeek、智谱 AI 和月之暗面等国内 AI 公司的一项重要原因。

可张一鸣的回应是:闭源不能蒸馏,开放权重也不能蒸馏。

这说明张一鸣反对的不只是 " 侵权式蒸馏 ",是任何形式的 " 用别人模型的输出作为自己能力的捷径 "。

在他看来,抄袭或者蒸馏,只能在短期内上个榜,可这个毛病,会干扰真正意义上的技术突破。

事实上,字节对蒸馏的警惕并非临时起意。

早在 2023 年 4 月,字节引入 GPT API 调用规范检查后,即明令禁止将 GPT 生成数据加入训练集;随后开展内部抽样检测,核查模型输出与 GPT 的相似度,防止数据标注人员私自使用 GPT。

在字节,这是一条已经延续了三年多的红线。

为什么张一鸣就是不肯抄作业?

外界猜测,可能是害怕美国制裁,毕竟 TikTok 在美国风险还是很高,字节不想给华盛顿抓把柄的机会。

但我们认为,张一鸣的野心是想做出有 " 定义权 " 的产品。

如果单靠蒸馏对手来追平榜单,那么企业开发的模型上限永远是对手的天花板,这就好比期末考试,你抄到了年级第一的答案,甚至发现了年级第一答案中的错误,加以改进,然后考的分数比年级第一还高。

可到了不能作弊的高考呢?

不抄袭的思路,和张一鸣一贯的产品哲学是一致的。

今日头条、抖音、TikTok,没有一个是从 " 抄美国模式 " 起家的,它们都是在中国市场的独特语境下,用算法和推荐系统重新定义了内容分发。

相反,阿里、百度、腾讯都不是。

所以字节的选择是,与其在乎一时的榜单排名,不如自己制定游戏规则。

怎么办?用好自己的数据。

据悉,字节正在启动一项包括 5 万亿参数的超大模型。由 Seed Foundation 负责人项亮主导,与大语言模型预训练数据负责人沈科合作,Seed 正在重新划分职责和分配资源。

8 月 6 日上午,字节跳动举办了 2026 年度年中全员会,公司 CEO 梁汝波表示,在大语言模型上,接下来字节跳动会坚持自研,接受短期落后,坚持优化长期。

这句话和张一鸣的 " 愿意为长期目标牺牲短期收益 " 形成了双重定调:字节的最高层的管理者,在同一个星期内,向内外释放了同一个信号。

尽管现在的通用语言模型榜单上,Seed 会继续被 Kimi K3、Qwen3.8、DeepSeek 压着,可一旦能跑通自有的 5 万亿参数模型,字节就将拥有国内首个真正意义上的 " 原生预训练超大模型 ",和专注于开源模型的同行拉开差距。

某种意义上,这就像苹果手机和安卓手机一样。

为什么一些安卓手机厂商喜欢在发布会上嘲讽苹果,却都在产品上对标苹果?

只能说,懂的都懂。

开源虽然能集 " 百家之长 ",可别人也能集你之长,虽然能 " 遥遥领先 " 一阵,但别人用你的成果再去训练自己的模型时,你拦都拦不住。

字节既然选了专有,也就必须选择 " 不蒸馏 "。

在一个所有人都在抄答案、所有人都在卷榜单、所有人都在吹牛逼的时代,有一个人愿意站起来说 " 我们不抄 ",这件事本身就是中国 AI 行业稀缺品。

至于这个稀缺品最后值多少钱?

要等。可能要等很久。

但历史一再证明,真正改变游戏规则的人,往往不是最聪明的那个,是最专注、最偏执的那个。

在 AI 的马拉松竞赛里,愿意慢下来的人,比愿意快起来的人,更值得尊敬。

-END-

欢迎点击下方名片关注无相商业趋势

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

张一鸣 ai 字节跳动 the
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论