TechWeb 19小时前
2026WAIC 昆仑万维董事长兼CEO方汉:2026为“世界模型元年”
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

【TechWeb】7 月 20 日消息,2026 世界人工智能大会(WAIC)期间,昆仑万维 " 世界模型与多模态范式跃迁 " 专场论坛在上海西岸国际会展中心举行。作为深耕 AI 科技领域的领军企业,昆仑万维在这场论坛上宣布核心模型重磅升级—— Matrix-Game 3.5 世界模型、Mureka v9.5 与 O3 音乐模型,全面覆盖世界模型、AIGC 创作等前沿赛道。昆仑万维董事长兼 CEO 方汉在论坛上宣布:2026 年为 " 世界模型元年 " ,标志着 AI 从内容生成走向对物理世界的理解与交互的关键转折。

方汉:2026 是 " 世界模型元年 ",三大产业预判锚定未来方向

在论坛主旨演讲环节,昆仑万维董事长兼 CEO 方汉正式宣布 2026 年为 " 世界模型元年 " 。他指出,过去两年 AI 行业的核心命题是 " 生成 " ——生成文字、图像、视频、音乐。而从 2026 年开始,AI 的核心命题将转向 " 理解 " 与 " 交互 " ——让 AI 真正理解物理世界的运行规律,并能与真实环境进行闭环互动。世界模型正是实现这一跨越的关键技术底座。

昆仑万维董事长兼 CEO 方汉

方汉在演讲中系统阐述了三大产业预判:

第一,世界模型将走出屏幕,进入物理世界。  我们洞察到,具身智能正从实验室走向真实环境,这一趋势要求机器人在行动前先进行环境推演——预判动作后果、评估环境变化、及时调整应对策略。这种能力的突破,将使竞争焦点从单一任务转向陌生环境下的通用模型能力;谁能训练出在复杂场景中依然 " 看得懂、做得对 " 的模型,谁就拿到物理智能时代的入场券,这也是中国智能制造和机器人产业真正亟需的底层能力。

第二,游戏行业将率先被世界模型改变。  开放世界游戏不再依赖数百人团队数年的手工搭建,Matrix-Game 3.5   让虚拟世界随玩家行动实时生长、持续演化。未来三到五年,世界模型将成为游戏行业的基础设施,彻底刷新内容生产方式,而国产模型已在这一赛道领跑全球。

第三,AI 音乐、AI 视频等工具将从技术试验变成大众创作工具,促进   AIGC   的深层发展。  Mureka 作为中国最强、全球前两名的音乐生成模型,率先去除 "AI 味 ",让普通人也能把模糊灵感转化为有情绪、有温度的作品。这并非替代音乐人,而是大幅降低创作门槛,让更多人的表达得以释放,从而根本性改变音乐乃至整个 AIGC   产业的创作生态。

三个产业预判,背后是同一个方向:让 AI 从 " 会生成 " 走向 " 懂世界 "、" 能行动 "。方汉表示,这不只是昆仑万维一家公司的回答,更是中国 AI 从研发走向产业应用的一个缩影。

AI 模型全球升级,掀起全模态内容生成革命

本次论坛上,昆仑万维集中完成了核心模型的全球重磅升级。

2.1 Matrix-Game 3.5:Patch 级记忆注入,重新定义交互世界模型

作为昆仑万维世界模型系列的最新迭代,Matrix-Game 3.5 在本次论坛上带来了革命性的技术升级。

Skywork 首席科学家成宇在论坛上正式发布了 Matrix-Game 3.5 世界模型。Matrix-Game 3.5 聚焦可交互世界模型技术,实现了 Patch 级别的记忆注入与系统级性能优化,5B 模型在 720p 分辨率下可实现单卡 20FPS 实时生成,具备 1 分钟记忆能力。

Skywork 首席科学家成宇

成宇指出,世界模型是具身智能的 " 无限数据引擎 "。传统数据采集面临人工成本高昂、实机采集耗时耗力、效率极低的痛点,无法满足大模型规模化需求。Matrix-Game 3.5 构建了支撑下一代世界模型的无限数据生产体系,突破传统瓶颈,打造三条自动化数据生产管线,输出 Video+Pose+Action+Language 的高质量训练数据,目前已积累超 500 万高质量视频切片、超 1 万有效训练小时数、覆盖 1200 余个游戏场景。

在技术架构上,Matrix-Game 3.5 创新性地将历史帧切分为带有 3D 坐标的 Patch Memory(通过 Depth+Pose Lift 到世界坐标系),推理时根据当前相机视锥检索可见 Patch 并重新投影到当前视角形成 Mosaic,再作为 Memory Token 注入 DiT,实现长期一致性的 Patch 级空间记忆。这一设计将 Frame-level FOV Memory 升级为 Patch-level FOV Memory,带来四大核心优势:更准确的空间记忆检索与跨帧一致性、更稳定的相机运动生成、最大程度保留基座模型动态生成能力的 In-context Learning、以及用户可自由编辑记忆块的可控记忆能力。

此外,Matrix-Game 3.5 在推理加速层面实现了 DiT 推理与 VAE 解码的全链路优化,通过 " 减少模型吞吐 +DiT 模型优化 +VAE 剪枝 " 三重手段,达成单卡 20FPS 720p 实时推理的业界领先性能,让高质量世界模型真正具备实时交互能力。

Matrix-Game 从 1.0 到 3.5 始终坚持开源路线。3.5 版本宣布核心架构开源,吸引全球开发者共建生态。Matrix-Game 2.0 是实时交互式世界模型技术范式中首个开源的实现方案,Matrix-Game 3.0 则首次系统性地将记忆问题纳入开源解决方案。

此前,DiT 作者、纽约大学助理教授谢赛宁团队基于 Matrix-Game 2.0 的开源底座,发布了全球首个多人视频世界模型 Solaris,也从学术圈的实际使用上印证了这套开源方案的基础模型价值。NVIDIA 和浙大联合发布的工作 Light Interaction 基于 Matrix-Game 3.0 模型进行研发。另外,NVIDIA 的 SANA-WM 和 Adobe 的 RELIC 等国际头部大厂世界模型均将 Matrix-Game 相关模型作为对比基准。

Matrix-Game 3.5   开源地址

https://github.com/Riemann-Dynamics/Matrix-Game-3.5

2.2. Mureka v9.5 与 O3:最没有 AI 味的 AI 音乐模型,让音乐进入 " 版本化制作 " 时代

Mureka v9.5&O3   音乐大模型的发布,成为本次论坛最具情感冲击力的时刻之一。

从 SkyMusic 1.0 内测到 Mureka v9.5&O3,昆仑万维的音乐模型走过了一条从 " 作品成立 " 到 " 创作可控 " 再到 " 多模态创作 " 的演进路径。而 v9.5 版本首次喊出 " 最没有 AI 味的 AI 音乐模型 " 这一口号——它不再依赖声部堆砌和复杂编配制造 " 厉害 " 的第一印象,而是在真实的音乐框架中,以更为克制的方式处理编配、人声、情绪与 Prompt 意图,让音乐表达更自然、更真诚。O3   建立在新版 V9.5   之上,并通过 test-time scaling   扩展 MusiCoT   的推理过程。它不是简单地 " 生成得更多 " 或 " 想得更久 ",而是让模型在生成过程中持续审视当前表达:局部旋律是否仍服务全曲目标,编配是否遮蔽人声,情绪是否提前透支,结构是否正在偏离最初意图。额外推理空间被用于回看偏差与自我修正,使音乐 CoT   能够逐步收敛,而不是一次决定后一路向前。

歌曲的主观评分

从评测结果看,V9.5   沿着 MusiCoT   路线完成了更扎实的底座升级:旋律、人声、音质和编曲全面提升,指令精准度从 6.92   提升至 7.62。它不再把 " 更满、更复杂 " 当作唯一标准,而是在真实音乐框架中更克制地处理编配、人声、情绪和 Prompt   意图,让歌曲更自然、更真诚。O3   则建立在 V9.5   之上,通过持续推演、回看偏差和修正后续决策,进一步强化旋律发展、编曲结构与指令理解,使歌曲结构更完整、情绪更连贯、段落关系更合理。简单来说,V9.5   负责把歌做得更自然,O3   负责让模型在交付前多看、多想、多修一遍。

今天,一首歌经常和视频一起被消费。短视频、游戏、影视预告、品牌片和虚拟人演出,都需要声音与画面共同表达。

Mureka   这次重磅升级,也把音乐与视频 MV   接进了同一条创作链路。用户可以从一张图、一段视频或 moodboard   开始,让系统理解画面的节奏、人物、空间和情绪,再生成与之匹配的音乐;当然,也可以从一首歌开始,让 Agent   理解歌词叙事、节拍编曲和情绪起伏,继续生成角色与 MV   的视觉方案。歌词决定叙事、节拍决定剪辑、旋律决定记忆点、画面决定传播场景。Agent   要做的,是让这些信息在同一个创作目标下持续传递,而不是把几个生成工具简单拼在一起。

更为重要的是,Mureka 已从单一的音乐生成工具演进为完整的 " 版本化制作 " 平台。其差异不仅来自模型效果,更来自 " 模型训练—推理时选优—版本化创作工具—平台分发 " 的系统组合。同一创意可快速生成多版本,支持在旋律、人声、结构等维度进行局部保留与替换;Studio 将 " 操作 DAW" 转化为 " 指挥创作 ",降低门槛、抬高上限。同时,Mureka 推出 Character 功能——一段声音、一张照片即可生成专属歌手角色,并贯穿歌曲、MV 全链路;AI 配乐能自动分析视频画面的场景、动作与情绪,创作更贴合内容的音乐;Mureka Agent 则通过自然语言一次对话调用整曲生成、单轨生成、Remix、延伸、MIDI 导出、声音克隆等全部能力,全程无需切换界面。

正如昆仑万维所提出的愿景:AI 音乐不再是简单的消费内容,而是升级为一种自我表达的语言。用户不仅是被动聆听者,更是主动表达者与参与者。Mureka 正以模型能力、创作工具与平台分发的完整闭环,重新定义 AI 时代的音乐创作生态,让每个普通人的灵感都能有温度地落地,从 " 一个想法 " 到 " 歌词—人声—角色—歌曲— MV" 的完整创作链路,全面释放 AIGC 的深层创作力。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

昆仑万维 ai ceo 音乐 物理
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论