全栈遛狗员 11小时前
面壁智能开源数据体系:400B代码+80K强化样本
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

面壁智能把 MiniCPM5-2B 背后的训练数据体系开源了。一句话概括:强模型始于强数据。这次放出的不是模型权重,而是喂出模型的 " 粮食 " ——从代码、Agent 训练到强化学习,一整套数据管线。

最新发布的四组数据分别是 UltraData-Code、UltraData-SFT-Agent-2609、UltraData-RL-2609 和 UltraX,覆盖代码、Agent 训练、强化学习和大规模数据精炼四个方向。

UltraX:把数据精炼变成可执行操作

UltraX 的思路有点特别——用函数调用的方式做数据精炼,把细粒度的编辑动作转成可执行的操作。目前开放预览版包含约100B tokens,分布在五个精炼后的网页数据集上。

这个量级意味着什么?它不是简单爬取网页堆数据,而是对原始网页内容做了系统性加工。函数调用式的精炼路径,让每一步编辑都有迹可循,而不是黑箱过滤。

UltraData-Code:11 种语言的代码数据

代码数据分了两层:UltraData-Code-L2 约400B tokens,UltraData-Code-L3 约150B tokens,覆盖11 种编程语言

L2 和 L3 的分层设计,暗示了数据质量或处理深度的差异。400B 的 L2 是广度铺量,150B 的 L3 更像是精挑细选后的高密度子集。对训练代码能力的模型来说,这两层数据构成了从 " 见得多 " 到 " 学得精 " 的阶梯。

Agent 训练样本:50 万条覆盖四类任务

UltraData-SFT-Agent-2609 提供约50 万条Agent 训练样本,横跨 Search、Code Agent、General Agent 和工具使用四大类。

任务类型覆盖得相当具体:

网页搜索

软件工程

多轮记忆

数据库交互

这四类任务基本对应了当前 Agent 落地最主流的场景。50 万条的规模不算夸张,但任务维度的完整度值得关注——它把 Agent 需要的能力拆成了可分别训练的模块。

强化学习样本:8 万条,三重过滤

UltraData-RL-2609 包含8 万条以上强化学习样本,覆盖数学、编程、知识和长上下文任务。

这批数据的筛选标准写得很明确:可验证性、奖励可靠性、难度匹配。三个维度分别对应 RL 训练中最容易出问题的环节——题目没法验证、奖励信号不可靠、难度和模型能力不匹配。按这三条过滤,说明数据团队踩过坑。

开源数据正在成为模型竞争的新战场

面壁智能这次放出的不是单个数据集,而是一套组合:代码、Agent、RL、数据精炼四条线并行。从 OpenBMB 持续增长的这批开源训练数据来看,模型能力的比拼正在从 " 谁的架构更巧 " 转向 " 谁的数据管线更扎实 "。

对开发者来说,这意味着可以直接复用这套数据体系去训练或微调自己的模型,而不必从零搭建数据管线。对行业来说,训练数据的开源程度,可能比模型权重的开源更能决定一个生态的活跃度。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

于强 开源 编程 数学 数据库
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论