星途科讯 1小时前
字节清华联合开源DAPO:Qwen-32B推理成绩超越DeepSeek
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

字节跳动 Seed 团队与清华大学 AIR 研究院联合推出完全开源的大规模大语言模型(LLM)强化学习系统 DAPO(Decoupled Clip and Dynamic sAmpling Policy Optimization)。该系统涵盖算法、代码基础设施及数据集,旨在为研究社区提供可扩展的强化学习实践路径。

核心突破:性能与效率双优

DAPO 提出了 " 解耦裁剪与动态采样策略优化 " 算法。基于 Qwen2.5-32B 基础模型训练的 DAPO-Qwen-32B,在 AIME 2024 基准测试中取得 50 分的成绩。值得注意的是,该模型仅用了此前最强模型 DeepSeek-R1-Zero-Qwen-32B 50% 的训练步数,即实现了性能超越。

训练监控数据显示,DAPO 在响应长度、奖励分数及熵值控制上表现出高度稳定性。响应长度的稳步增长促进了复杂推理模式的学习,而受控的熵值平衡了探索与利用,有效避免了过拟合或过度随机化。

全栈开源:从算法到数据

为实现高复现性,团队开源了包括算法细节、基础设施及数据集在内的完整训练配方。系统基于 verl 框架构建,并在火山引擎机器学习平台上完成实验验证。

数据集:提供经过精心筛选的训练集 DAPO-Math-17k 及验证集 AIME 2024。

训练脚本:提供开箱即用的复现脚本,包含两个版本:一是不含 Token 级策略梯度损失和动态采样的早期版本(AIME 得分 44);二是完整版 DAPO(AIME 得分 50)。相关训练记录已在 Wandb 公开。

推理部署:支持通过 Ray Serve 和 vLLM 进行模型部署与评估,并提供基于 Huggingface 及本地路径的加载示例。

目前,DAPO-Qwen-32B 模型权重已公开,开发者可通过提供的 Python 代码快速集成并进行数学推理任务测试。团队表示,后续将在火山引擎平台上提供完整的复现指南,以进一步降低社区使用门槛。

【星途科讯 图文丨小林 首发于 ZAKER 科技,转载请注明出处】

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

python 开源 基础设施 字节跳动 机器学习
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论