DAIR.AI 公布了 9 月 14 日至 20 日的 Top AI Papers 榜单,Meta 一项关于字节级语言模型缩放规律的研究排在最前面。
这项研究做的事,是看字节级语言模型随着算力增长会呈现什么样的缩放规律。它没有停在观察层面,而是给出了两种从 token 教师模型蒸馏出 1B 字节学生模型的方法:Marginalize-It 和 End-Of-Token。

两种蒸馏路径的差别
两种方法都指向同一个目标——把 token 教师的能力迁移到字节学生身上。研究随后拟合出的缩放律给出了对比结果:在渐近线上,End-Of-Token 学生领先蒸馏 token 模型最多 4%。

更值得看的是数据效率这一项。End-Of-Token 学生仅用六分之一的训练数据,就能追平蒸馏 token 模型。
换句话说,同样的追赶目标,一条路径要烧掉六份数据,另一条只用一份。这也是它能在本周论文榜上被单独拎出来的原因。


登录后才可以发布评论哦
打开小程序可以发布评论哦