InfoQ 17小时前
前DeepSeek核心研究员魏浩然出任百度文心多模态算法负责人
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

作者 | 四月

9 月 3 日消息,据知情人士向 AI 前线透露,原 DeepSeek 核心研究员魏浩然已于近日带队转入百度基础模型研发部,出任文心大模型多模态算法负责人。

这是近期百度大力布局青年顶尖大模型研发人才的又一动作。今年 7 月,出生于 1997 年、曾主导国内首个开源对话模型复旦 MOSS 研发的青年学者孙天祥出任百度基础模型研发部(BMU)负责人,随后进驻百度模型委员会(BMC)与技术战略委员会(TSC)。

从孙天祥统管通用基座,到魏浩然挂帅多模态算法,可以看到,百度的模型研发中枢正加速向青年技术骨干倾斜。

多模态战绩突出

在大模型向更深层次通用智能演进的路径中,多模态能力已被公认为决定模型上限的核心支柱之一。而魏浩然身上最鲜明的技术标签,正是多模态与端到端 OCR 的底层重构。

据了解,魏浩然于今年上半年加入百度,此前主要负责 OCR 等多模态方向研发。入职后,他带领团队在端到端文档感知领域取得了重大突破,并于 2026 年 6 月 22 日开源了 Unlimited OCR 模型。该模型在业内权威的文档理解评测基准 OmniDocBench 测试中取得了全球第一的成绩,刷新了端到端 OCR 性能的 SOTA 纪录,登上 GitHub 和 Hugging Face 多个趋势榜单。

公开资料显示,魏浩然 2023 年博士毕业于中国科学院大学,此后长期专注于视觉语言模型(VLM)和文档智能研究。在加入 DeepSeek 之前,他曾供职阶跃星辰(StepFun)等公司,主导并参与了 Vary、GOT-OCR 2.0 等多项业内代表性工作。

进入 DeepSeek 后,魏浩然进一步成为 DeepSeek-OCR 路线的核心研究者。在 2025 年 10 月发布的《DeepSeek-OCR: Contexts Optical Compression》、2026 年 1 月发布的《DeepSeek-OCR 2: Visual Causal Flow》论文中,魏浩然均为第一作者。该工作在学术界和工业界引发高度关注,它没有局限于字符识别精度的提升,而是率先提出了 " 利用视觉表征极限压缩长文本信息 " 的全新技术思路。

模型通过自主研发的 DeepEncoder,将传统方法中成千上万个文本 Token 压缩为数量大幅减少的紧凑视觉 Token;在压缩率低于 10 倍的极端条件下,模型依然能够保持约 97% 的 OCR 解码准确率。这一探索为解决大模型长上下文输入时的显存暴涨与计算开销过大问题,开辟了一条极具想象力的高效路径。

除了 OCR 专项模型,魏浩然也参与过 DeepSeek 通用基础模型研发。在 DeepSeek V3.2 作者名单中可以找到他的名字;今年 4 月发布的 DeepSeek V4 技术报告中,魏浩然同样位列作者,但已经被标注为离职成员(标星为离职人员)。

青年骨干接管研发体系

魏浩然的调整发生在百度大模型组织持续变动的背景下。

2025 年 11 月,百度新设基础模型研发部 BMU 和应用模型研发部 AMU,将底座模型与应用模型研发进一步拆分。其中 BMU 负责高智能、可扩展的通用基础模型,AMU 则更多面向具体业务和场景进行模型研发。

今年 5 月,百度又成立模型委员会 BMC,进一步统一模型技术路线、训练和业务落地。

7 月 1 日,复旦 MOSS 大模型核心第一作者、前 AI4S 创业公司 " 日行迹 " 创始人孙天祥正式加盟百度,执掌 BMU 并进入 BMC;7 月底百度技术战略委员会(TSC)换届,孙天祥等一线青年技术专家进一步进入 TSC,标志着百度基础模型的技术决策权正式完成向新生代实战学者的交接。

在这一背景下,魏浩然此次带队进入 BMU,本质上是孙天祥全面接手基础模型部门后,文心作为研发阵地重新集结的关键拼图。

另据网络流传信息,孙天祥近期还在内部宣布引入一名花名为 " 武钦 " 的研究人员,此前曾在北美某顶级前沿实验室参与数代核心大模型的研发与迭代,未来将协同团队加强文心大模型预训练能力的底层建设。

声明:本文为   AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

百度 ai 开源 中国科学院大学
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论