像素与芯片 10小时前
字节级模型缩放登顶论文榜:少用六分之五数据追平
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

DAIR.AI 公布了 9 月 14 日至 20 日的 Top AI Papers 榜单,Meta 一项关于字节级语言模型缩放规律的研究排在最前面。

这项研究做的事,是看字节级语言模型随着算力增长会呈现什么样的缩放规律。它没有停在观察层面,而是给出了两种从 token 教师模型蒸馏出 1B 字节学生模型的方法:Marginalize-ItEnd-Of-Token

两种蒸馏路径的差别

两种方法都指向同一个目标——把 token 教师的能力迁移到字节学生身上。研究随后拟合出的缩放律给出了对比结果:在渐近线上,End-Of-Token 学生领先蒸馏 token 模型最多 4%

更值得看的是数据效率这一项。End-Of-Token 学生仅用六分之一的训练数据,就能追平蒸馏 token 模型。

换句话说,同样的追赶目标,一条路径要烧掉六份数据,另一条只用一份。这也是它能在本周论文榜上被单独拎出来的原因。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

规律
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论