责编 | 梦依丹
出品 | CSDN(ID:CSDNnews)
如果说过去的生成式 AI 解决的是「创造内容」,那么下一阶段解决的是「创造世界,以及在世界里行动」。
一首歌,要从随机生成走向结构可控。
一个世界,要从视频生成走向实时交互。
一台机器人,要从理解画面,走向预测动作之后会发生什么。
这三件事看起来不同,背后其实都在逼近同一个目标:让模型真正理解结构、环境与因果。
11 月 20 — 21 日,在 2026 奇点智能技术大会上,昆仑万维集团首席科学家成宇将第一次把这三条产品线放到一起系统复盘:Mureka v10 音乐模型、Matrix-Game 4.0 世界模型与 Riemann-1.0 机器人模型。
他现场分享的并不是模型 Demo,而是这些产品背后真正决定能不能落地的工程选择。
所以从 Mureka 到 Matrix-Game,再到 Riemann,真正被串起来的不是三条产品线,而是一条更大的技术路线:从生成内容,到建模世界,再到进入物理世界。
一位首席科学家的两条线索
成宇之所以来讲这三个方向,也和他过去的研发经历有关。
一条是产业侧的。2021 到 2023 年,成宇在微软雷德蒙德研究院任首席研究员,带团队与 OpenAI 紧密合作,参与 GPT-3.5、GPT-4 和 DALL-E 的优化微调,推动这些模型的服务与应用落地。从 2023 年到 2025 年,他主导或者参与了 Minimax abab6.5、M1/Hailuo Video 等模型的研发落地。现在,他是昆仑万维集团首席科学家。
另一条是学术侧的。他任南洋理工大学讲席副教授,累计在 NeurIPS、ICML、ICLR 等人工智能顶会,以及 Nature、Science 及其子刊发表论文 100 余篇。他还担任 ICML 和 NeurIPS 高级领域主席,CVPR、ICLR、ACL、ACMMM、NAACL 领域主席,以及 TMLR、TIST 杂志责任编辑。论文曾获 NeurIPS 2023 杰出论文奖、WACV 2021 最佳学生论文荣誉奖、SDM 2015 最佳论文入围奖。
串起这两条线索的,是他的研究方向:模型高效架构、模型压缩、混合专家模型、多模态大模型。
这几个词指向同一件事,用更小的代价换更好的效果。模型压缩让模型变小变快,MoE 让每次推理只激活一部分参数,高效架构则在结构层面重新算这笔账。
回头看开头那三个词,结构、环境、因果,它们分属三个方向,落地时却撞上同一类约束:模型要够小、够快、够省,才谈得上可控、实时和泛化。而这恰好是他一直在做的事。
Mureka v10:结构可控,让音乐从随机走向编排
AI 生成音乐这两年进步很快,但有个问题一直没被彻底解决:段落随机性。
落到产品上,这就成了可用性问题。用户要的通常不是「再来一段」,而是「三段式、两分钟、情绪从低到高推上去的配乐」。
Mureka v10 给出的解法,是 DiT 混合架构下的「结构可控生成」。
DiT 用 Transformer 替换传统扩散模型里的 U-Net 骨干,已经是高质量音频与视频生成的主流选择。而「混合」意味着它不是单一架构,而是在结构控制与生成质量之间做取舍。
这条路径要解决的正是段落随机性这个顽疾:让结构成为可控变量,而不只是采样之后的运气。
架构怎么搭、控制条件怎么注入、结构约束和生成自由度之间怎么平衡,会是现场展开的部分。
Matrix-Game 4.0:实时交互,让世界从视频走向可玩
世界模型今年很热,但「生成能交互的游戏画面」和「生成能玩的游戏」之间,隔着一个很硬的限制:速度。
扩散模型需要多步去噪才能出一帧。离线生成可以接受,实时交互不行。
Matrix-Game 4.0 的做法分两步:
第一步是画面:以创作的低模游戏画面为参考,输出重渲染的精细游戏画面。内容层用低成本的低模画面定义,呈现层由模型实时重渲染成高精度画面,这把「生成什么」和「渲染成什么样」拆成了两个问题。
第二步是速度:采用 causal + DMD 蒸馏。causal 保证生成过程的因果性,让模型可以流式地产出连续帧。DMD 则把多步去噪压缩到极少步数。
目标很明确,让生成速度达到实际游玩的门槛。
这一步跨过去,一个「世界」才不只是被生成出来的视频,而是可以进入、可以交互的环境。
Riemann-1.0:因果预测,让机器人看懂走向预判
对应到机器人身上,要求就不只是看懂画面,还要能预判一个动作之后会发生什么。这一步跨过去,模型才算真正进入物理世界。
Riemann-1.0 是昆仑万维的机器人模型,这场分享公开的是它的三阶段渐进式预训练体系。
机器人基础模型的难点和文本、图像不太一样。
第一个在数据:来源极其分散,遥操作轨迹、人类视频、仿真数据、不同传感器的记录,格式和质量差异都很大。Riemann-1.0 建了一条自动化的多源数据清洗管线,处理规模是 23.2 万小时。这个量级决定了清洗只能靠管线,不可能靠人工。
第二个在泛化:不同机器人的本体结构、自由度、传感器配置各不相同,在 A 型上训好的策略,换到 B 型可能完全失效。Riemann-1.0 公开的跨本体迁移策略,针对的就是这件事。
三阶段渐进式预训练、自动化清洗管线、跨本体迁移,三个词背后是一整套工程选择。这场分享讲的是这些选择是怎么做出来的。
一场复盘,比一场发布更有信息量
成宇分享的内容全部源自真实研发复盘,也是这三条产品线关键工程决策的首次系统性拆解。哪些决策是在什么约束下做出的、哪些方案被否掉了、哪些环节的效果和预期不一样。对正在做生成式 AI 的团队来说,这些往往更难拿到,也更有用。
这场分享只是 2026 奇点智能技术大会众多议题中的一个切面。
大会将于 11 月 20-21 日在北京万达文华酒店举行,届时,2026 C++ 及系统软件技术大会也将同期举行。上层 AI 应用的爆发,离不开底层系统软件的支撑,两条技术脉络将在同一个现场交汇。
两场大会共规划 18 大前沿专题,围绕 RSI、Agent、世界模型、Physical AI、AI Infra、AI 原生软件研发等个前沿方向展开,从模型能力一路讨论到工程体系与真实业务落地。
目前已经确认的嘉宾阵容覆盖了 AI 技术演进的多个关键方向,其中包括:
Ł ukasz Kaiser OpenAI 资深研究科学家、Transformer 八子之一
段楠 京东集团副总裁、京东探索研究院副院长
张俊林 新浪微博首席科学家及 AI 研发部负责人
李宇轩 面壁智能技术合伙人、智能进化首席科学家
俞扬 南京大学人工智能学院副院长、教授
董汉德 腾讯 WorkBuddy 模型研发负责人
郑鑫祺 小红书 AI Coding 总架构师
郑耀威 PrismShadow(千影光流)联合创始人兼 CTO、LlamaFactory 作者
……
当 AI 从模型走向系统、走向生产,我们到底需要怎样的新技术栈?
对正在做世界模型、多模态生成、具身智能的团队来说,成宇这场尤其值得留意。它讲的不是「做出了什么」,而是「怎么做出来的」。
现在注册报名参会,还可领取《AI 原生软件研发成熟度模型 AISMM 2026》白皮书。
AISMM 不是一份「AI 工具清单」,而是一套面向企业 AI 原生研发转型的系统坐标系。它从基础设施、知识工程、流程工具、组织人才、安全治理五个维度切进去,把成熟度分成五个阶段:L1 辅助提效、L2 领域集成、L3 Agent 协同、L4 自主代理、L5 自进化工厂。
这套坐标系,是为了帮企业和技术 Leader 回答三个最关键的问题:我们现在在哪?下一步该往哪里走?应该优先补哪块能力?
白皮书同时提供成熟度自评、行业对标与演进路线图,可用于识别 AI 转型中的短板,避免只买工具、不改体系,把个体提效真正转化为组织级生产力。


登录后才可以发布评论哦
打开小程序可以发布评论哦