手游那点事 08-28
腾讯游戏科隆曝光:这套AI管线已接入超90个项目,提效8倍
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

文 / 游戏那点事 零

在本届科隆国际游戏展开发者大会上,AI 相关议题明显升温。今年大会还专门设置了两条 AI 专题赛道:AI in Gameplay(聚焦 AI 如何改变玩法)和 AI in Production(聚焦 AI 如何提升生产管线)。这种 " 玩法 + 生产 " 的双线路径,与腾讯游戏此前提出的 AI 应用框架不谋而合。

值得注意的是,今年 AI 议题共计 32 场,其中涉及具体应用的议题数占比超过 50%,可以看到,AI 与生产管线的结合正成为行业趋势。 腾讯、EA 等海内外公司的开发者纷纷展示了各自在 AI 应用中的探索,从分享的内容来看,中国厂商在游戏 AI 应用方面,正在引领全球。

其中,腾讯游戏公共技术线 Motus AI Team 负责人曾子骄带来了一场题为《Breathing Life into Geometry 2.0: Advancing the Unified AI Pipeline for 3D Character Animation》的分享。

(腾讯游戏统一 AI 角色动画管线分享现场)

这场演讲讨论的并不是一个孤立的 " 文生动作 " 功能,而是一条覆盖角色绑定、蒙皮、多模态动作生成与动作精修的统一 AI 管线。它试图解决游戏角色生产中最耗时的两段工作:先让静态几何模型拥有可驱动的骨骼与蒙皮,再把文本、视频、关键帧和音频等输入变成能够进入生产流程的动画。

最直观的变化体现在制作效率上:过去,一个相对简单的角色服装也需要约 3 个人日完成绑定与蒙皮,复杂服装最多要约 4 天;接入 Motus AI 后,复杂服装连同美术师后续修整在内,可以缩短到 1 — 4 个人时。目前,这套技术已经接入 90 多个内外部项目,腾讯称效率提升超过 8 倍。

(Motus AI Team 的主要研究方向)

这套管线追求的不是 " 看起来像动作 " 的研究演示,而是生产级动画:脚不能滑、身体不能抖、角色不能漂浮或失去平衡,模型还要适配不同类型的角色,并把结果交还给动画师继续编辑。

最让人印象深刻的是,本次分享,其发布了业界首个多指令、任意长度的文生动作大模型,支持无限长动作序列生成,生成结果指令遵循度好,长时间一致性强,不漂移。

(Motus AI 发布业界首个多指令、任意长度文生动作大模型)

以下为游戏那点事整理的分享实录,为优化阅读体验有所调整:

从几天到几小时

AI 先接管绑定和蒙皮

大家下午好,我是曾子骄,腾讯游戏 Motus AI Team 负责人。

今天分享的是我们团队最新的进展——《让几何模型焕发生命 2.0:面向 3D 角色动画的统一 AI 管线》。过去大家看到的可能是这条管线中的不同模块,现在我们想把它们放在同一条端到端流程里。

我毕业后加入腾讯游戏,此后一直从事游戏 AI 相关工作。早期我参与过斗地主 AI 智能体的研发,它把深度学习与博弈树搜索结合起来,并实现了规模化部署。

后来我带领 Motus AI Team,把工作重点转向 3D 角色:一方面研发大规模角色绑定与蒙皮模型,另一方面研发多模态动作生成模型。相关工作也曾在 GDC、SIGGRAPH 等顶会上进行分享。

一款游戏最先抓住玩家的,往往是视觉呈现,尤其是主角如何运动。高质量角色动画既是游戏生产的核心组成部分,也是玩家最直接看到的内容之一。

完整的 3D 角色生产通常从二维概念设计开始,接着进入建模、UV 展开和贴图制作,最后进入动画流程。动画流程又可以拆成两个主要部分:第一是绑定和蒙皮,第二是骨骼动画。我们今天的工作,主要围绕这两部分展开。

(3D 角色从概念设计、建模到绑定蒙皮和骨骼动画的完整流程)

绑定和蒙皮决定了角色服装如何被骨骼驱动。网格上的每一个顶点会受到一根或多根骨骼影响,各骨骼权重之和必须为 1。绑定负责建立骨架,蒙皮负责把网格与骨骼之间的驱动关系写进权重。它们的原理并不难理解,但手工处理非常耗时。

按照我们的生产经验,一个简单服装大约需要 3 个人日,复杂服装最多要 4 天。使用 Motus AI 后,一个复杂服装连同美术师修整在内,可以从数天缩短到 1-4 个人时。

(传统手工权重绘制与 Motus AI 端到端处理的流程对比)

要把自动绑定和蒙皮真正放进生产流程,我们首先需要面对三个问题。

第一个问题是建模与表示。3D 资产的形状和拓扑差异很大,系统必须找到一种有效方式,表示异构的 3D 数据,以及网格与骨骼之间的关系。

第二个问题是冷启动。游戏角色风格千差万别,我们希望得到的是一个通用模型:它拿到新的角色后能够零样本工作,而不是每遇到一种项目风格,就重新做一次微调。

第三个问题是长尾案例。多层服装很容易出现网格穿插和不均匀变形,这些问题在展示用样例里或许可以绕开,在真正的项目里却不能回避。

(自动绑定与蒙皮要解决的三类难题:表示、冷启动和长尾案例)

因此,我们把整套方案拆成三层。第一层是 Skeleton Generation AI,根据任意角色网格生成对应骨架;第二层是 General Skinning AI,根据网格和骨架自动生成全部顶点的蒙皮权重;第三层是一组后处理 AI,专门修复前两步中表现不够好的区域。

从自动化率看,骨骼生成目前约为 50% — 70%,通用蒙皮约为 70% — 85%,在加入后处理后可以超过 85%。这里的思路是先用通用基础模型覆盖主体工作,再用专门工具收掉生产中的长尾问题。

(Skeleton Gen、General Skinning 与后处理 AI 组成的三层框架)

Skeleton Generation AI 提供了几种不同的工作模式。用户既可以上传任意 3D 角色模型,全自动生成与角色贴合的完整骨架;也可以输入一套参考主骨架,在保持模板拓扑的情况下适配新角色;如果角色已经有主骨架,还可以只为裙摆、头发等部位补充物理辅助骨骼。

系统也支持多样化采样。美术师可以调整滑杆参数,为同一个角色生成不同的骨骼拓扑。骨架生成后,用户还可以选择 Maya Advanced Skeleton ( ADV ) 或 HumanIK,自动创建相应的控制绑定,用于后续摆姿势和制作动画。

这套骨骼生成模型采用类似 GPT 的自回归架构,参数量超过 10 亿。它以完整角色网格为输入,通过网格表示理解局部几何与拓扑,再逐步生成完整的骨骼层级,也可以在已有主骨架的条件下继续生成物理辅助骨骼。

(超过 10 亿参数的自回归骨骼生成模型)

现在的案例已经覆盖人形、四足动物、怪物,甚至部分道具,也可以为头发、裙摆和饰品生成复杂的物理骨骼。这些结果不是只用于演示,而是已经进入实际美术管线,骨骼生成环节在真实项目中能够减少约 30% 的耗时。

有了骨架之后,下一步是通用蒙皮。这里是一个 ACG 风格游戏中的典型角色,带有复杂的裙装和头部饰品,大约有 2.5 万个顶点、180 根骨骼,其中包括多根物理骨骼和修正骨骼。选中所有网格及其对应骨骼后,就可以启动自动蒙皮;根据网格和骨骼的复杂度,整个过程约需 10 秒到 2 分钟。

完成后,头发和裙摆等区域已经能够跟随原有骨骼动画变形,一键完成度超过 80%,几乎看不到明显瑕疵。通用蒙皮模型采用四阶段、由粗到细的框架,结合 DGCNN 与 Transformer,逐步完成浅层表示、深层空间特征提取、骨骼链分析和具体骨骼预测,最后为每一组 " 顶点—骨骼 " 关系生成准确权重。

这个模型的参数量超过 13 亿,使用大规模高质量数据集,在 80 张 GPU 上训练了 90 天。

(通用蒙皮基础模型的四阶段架构与训练规模)

大家可以看到,每段视频的左侧是美术师手工制作的蒙皮结果,右侧是 GoSkinning 的输出,测试时几乎很难分辨二者。

这些案例来自各个不同风格的项目。我们的 General Skinning AI 不只处理人形角色,也能处理四足动物、武器等刚性物体,以及差异很大的服装风格。

(GoSkinning 在不同项目和服装风格中的一键蒙皮结果)

但把模型做大,并不等于生产问题就全部解决了。一个模型能不能真正投入使用,取决于它能否补齐长尾案例。裙装就是最典型的难点:当服装由多层网格构成时,通用模型容易出现层与层之间相互穿插、变形不均匀等问题。而在我们的项目中,超过一半的角色都穿着这类服装,它并不是罕见情况。

因此,我们没有继续让通用模型独自承担全部任务,而是制作了一套专门的 Skirt Skinning AI。它分成两个阶段:先为输入裙装生成一层与原几何形状匹配、但拓扑更干净简单的代理网格,再对代理网格运行通用蒙皮;随后把权重迁回原始网格,并进行针对性的变形优化。

右侧并排展示了三种结果,从左到右分别是手工蒙皮、通用蒙皮 AI 和我们的裙装蒙皮 AI。可以看到,专用流程明显减少了网格穿插和不均匀变形,结果已经接近手工制作。不过我们也必须承认,自动绑定与蒙皮仍然不擅长处理拥有大量修正骨骼的极复杂角色,我们正在积极解决这个问题。

(利用代理网格、权重迁移和变形优化处理多层裙装)

动作生成真正难的

不是 " 能动起来 "

接下来进入动作生成部分。

传统流程主要有两种做法:手工制作关键帧,或者进行动作捕捉。一个 10 秒的手 K 动画可能需要大约 5 天,也就是完整的一周;即使使用动捕,后续清理仍然需要 2 — 4 天。

我们据此开发了多种 AI 工具,今天重点介绍两类:一类是文本生成动作和视频生成动作,另一类是用于补帧与精修的 Motion In-Betweening。它们共同覆盖从动作生成到后续编辑的流程。

(传统动作生产与 AI 原生动作管线的效率和控制方式对比)

过去几年,学术界的动作生成大致经历了三个阶段:先是自回归方法,之后 GPT 类架构和扩散模型成为主流,再到人物与物体、人物与人物、人物与场景之间的交互动作。论文数量持续增长,但学术结果与生产级要求之间依然存在距离。

(动作生成研究从自回归、扩散模型走向交互和部署)

原因在于,游戏生产需要同时做到三件事。

第一是生产质量。脚滑、抖动、网格穿插、身体漂浮、平衡异常,任何一个问题都不可接受。目标不是得到一个 " 说得过去的动作 ",而是得到可以继续进入生产流程的动画。

第二是通用性。同一个系统要覆盖怪物、射击、武术等完全不同的角色和动作类型,不能只在某一个类别上表现良好。

第三是美术师控制。动画师需要修改、指导并继续打磨模型输出,而不是被迫接受黑箱一次性生成的结果。

因此,不仅要质量高、通用性强,而且可以让用户可控、编辑,得到美术师想要的结果。

(生产级动作生成必须同时满足质量、通用性和美术师控制)

我们最早尝试的是基于离散动作 Token 的自回归基础模型,例如通过 FSQ、RVQ 等方式把动作压缩成有限码本,再像语言模型一样生成序列。

问题在于,离散化本身存在一个硬上限:动作在进入码本时损失的信息,后面再大的模型也无法恢复。

在我们的实验中,即使有效码字超过 20 万个,重建动作仍然与真实动作出现明显偏差,例如脚部位置漂移。也就是说,Token 重建误差会直接限制动作保真度。

(超过 20 万个离散编码仍无法消除动作重建误差)

这促使我们转向用 Motion Diffusion Transformer,也就是 Motion DiT,作为基础模型。这里不再先把动作离散成有限 Token,从源头避免离散化造成的不可逆损失。

经过架构、动作表示和数据规模的共同优化,MPJPE 降低 33.8%,NPSS 降低 23.3%,Foot-Skating Error 降低 60.2%。随着训练数据上升,姿态误差也从 4.4352 下降到 4.0602、3.9034。

(Motion DiT 的动作质量优化与数据扩展结果)

在优化后的 Motion DiT 主干上,我们进一步加入多种输入模态。每一种模态都有自己的 Context Transformer,把不同条件编码成共享表示,再送进同一个主干 Motion DiT。

它的输入可以是文本、视频、关键帧和音频;输出也不只是身体动作,还可以同时生成手势、口型和面部动画。

我们的核心选择是 " 一个主干,多种输入 ":真正承担生成能力的是统一的基础模型,前端再针对输入模态进行专门化。未来增加新的控制信号时,原则上只需要增加一个编码器,而不是从头训练一个新模型。

(统一的 15 亿参数 Motion DiT 及其多模态输入输出)

但只有生成模型还不够。专业动画师不只需要 " 一键生成一个动作 ",他们还需要编辑、精修,并把结果放进真实的生产管线。

基于这个基础模型,我们开发了一条贴合动画师实际工作方式的 AI 动画管线。左侧是多模态动作生成,包括文本生成动作、视频生成动作和音频驱动动画;右侧是 Motion Polish,为美术师提供关键帧条件编辑、动作精修和更广的生产场景覆盖。

这正是 Motus AI 与研究演示的区别:它是按照游戏美术师实际工作的方式来设计的,而不只是为了跑分。

(Motus Motion 将多模态生成与动作编辑、精修连接起来)

文本、视频与关键帧

开始进入同一套动作管线

文本生成动作的推理流程有三个核心组件。第一是 Prompt Rewrite Model。它先把用户输入的自然语言提示改写成结构化描述。

第二是 Duration Model。它读取改写后的提示,自动预测这段动作应该持续多长时间。第三才是动作生成模型。文本被编码后,与时长等条件一起送入 Motion DiT,最终输出 3D 动作。

(Text-to-Motion 全新版本 V1.5 版本发布)

大家可以看到,生成的动作与提示词高度一致。这里的对比既有日常动作,也有战斗和移动动作;其他模型的结果在左侧,我们的结果在右侧,重点看模型能否准确理解描述,同时保持动作自然。

(文本生成动作在语义对齐和动作质量上的现场对比)

为了生成更长的动作,我们还开发了 Multi-Segment Joint Denoising。它让模型同时接收多段文本提示,生成任意长度的动作序列,从而避免简单拼接带来的断点。

第一段视频是一段由 7 条文本提示生成的 30 秒动画:角色先快速向前奔跑,随后遭到攻击、失去平衡、倒地,再从俯卧状态起身,最后捂住腹部踉跄前进。大家可以看到,模型不只要分别满足每一段描述,还要让段与段之间自然衔接。第二段则是一段由 4 条提示生成的 31 秒动画,用来展示风格化动作和连续过渡。

目前,我们已经在腾讯游戏内部把这项能力投入生产,用于动作概念设计、游戏原型和演示,也用于扩充动作捕捉数据集。

(多段联合去噪让 7 条文本提示生成 30 秒连续动作)

视频生成动作沿用同一套 Motion DiT 主干。系统先从输入画面中提取人物框和跟踪结果、二维关键点、相机姿态与三维姿态,再通过 Context Transformer 把视频条件送入生成模型,输出能够直接驱动游戏角色的完整 3D 动作。

其中,三维姿态表示由我们内部预训练,数据来自大规模姿态合成流程。它为我们提供了比现成姿态估计器更稳定、更鲁棒的姿态先验。

这项能力需要同时解决两个问题。第一是细节保真,包括身体姿态、重心转移和细微的上半身动作;第二是脚步稳定,落脚时要保持接触,尽量减少脚滑。只有姿态大致相似、脚却在地面上漂移的动作,很难直接投入制作。

(视频生成动作对细节还原和稳定脚步的强调)

这是我们的 Video-to-Motion V2 预览模型,主要有两处变化。第一,输入范围扩大了:过去只能处理现实拍摄视频,现在也能处理游戏风格的虚拟画面、风格化角色,以及带真实相机运动和镜头切换的片段。

第二,全局轨迹更准确了。过去的版本在处理复杂 3D 轨迹时,容易把路径压平,甚至完全丢失;现在大家可以看到,生成的全局路径能够贴近参考视频,不会在空间中漂移。对于游戏制作来说,全局轨迹不是 " 锦上添花 ":如果轨迹不对,无论局部姿势看起来多好,整段动画都会不稳定。

(Video-to-Motion 2.0 预览版对姿态、脚步、轨迹和遮挡的改进)

最后一个重点模块是 Motion In-Betweening,也就是 MIB。它不是单纯再生成一段动作,而是承担 " 补间 " 和 " 精修 " 的角色。

它仍然使用同一个 DiT 主干:输入关键帧,输出完整动作序列。MotionBlink MIB 可以自动补全最长约 1.5 秒的关键帧间隔,质量接近光学动捕;在演示配置下,生成 200 帧动画约需 4 秒。

(MIB 根据部分关键帧合成完整动作序列)

我们最新的 MIB Beta 接近 10 亿参数。大家可以看图:绿色是真实动捕,透明蓝色是输入关键帧,灰色和浅蓝色分别是 Alpha 与 Beta 版本的结果。即使面对舞蹈、体育和受伤后退等复杂案例,Beta 版本也能保持准确和细节。

根据我们收到的用户反馈,在写实动作上,生成质量已经可以与动作捕捉相媲美。固定相同的关键帧、更换随机种子,还能得到多种自然的动作结果。

(接近 10 亿参数的 MIB Beta 与动捕、关键帧及 Alpha 版本对比)

90 多个项目之后

统一模型还要走向游戏 VLA

回到整条管线,我们围绕动画生产的两个阶段形成了一套 AI 工具:自动绑定、自动蒙皮、后处理、多模态动作生成,以及连接生成结果与美术师编辑流程的 Motion Polish。

绑定和蒙皮过去需要几天,现在复杂服装可以在几个小时内完成;动作部分则先由模型生成基础动画,再交给美术师编辑和精修。效率提升并不意味着把美术师移出流程,相反," 可编辑、可控制 " 是生产级系统必须满足的条件。

(从角色网格到动画的端到端统一生成式 AI 管线)

我们的相关项目包括 PUBG Mobile、LOL Mobile、Wuthering Waves、QQ Dancer、Moonton 等;Motus Motion 也已经在多个核心业务中使用。目前,这套技术已经接入 90 多个内外部项目。

(Motus AI 已接入 90 多个内外部项目)

接下来,我们计划继续推进两个方向。一个方向是大型统一多模态动作生成模型,把动作生成、理解和编辑能力放进同一个模型。另一个方向是游戏中的 Vision-Language-Action Model,让模型理解场景与语言,再控制角色完成翻越、滚动等与环境互动的动作。

最后,所有这些工作都可以归结为一个想法:One Engine, Infinite Characters。用一个统一引擎支撑无限种角色,让创作者把更多精力放回创意本身。

(Motus AI 的下一步:统一多模态动作模型与游戏 VLA)

以下为分享后的现场问答:

问:文本生成动作能否理解 " 优雅 "" 震惊 " 这种带有表演意图的描述?如果结果与导演想法有偏差,能不能像指导真人演员一样继续修改?

曾子骄:我们设计的工作流会尽量贴合动画师原有的工作方式。首先可以通过视频、文本等输入生成完整动作序列;如果结果与想法不一致,美术师可以修改关键姿势,再使用 MIB 工具重建和精修整段动作。

问:训练数据是怎样构建的?

曾子骄:我们有一条数据管线。通过专业的设备捕捉,建立视频与动作之间的对应数据,然后用于模型训练。

问:这些工具可以在哪些平台使用?能否输出到 Godot、Unity 或 Unreal 等引擎?

曾子骄:目前可以通过网站和 DCC 插件使用,例如 3ds Max、Blender、Maya,以及 Unreal Engine。

—— 点击下方公众号名片,即刻关注我们 ——

——————— End ———————

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 腾讯游戏 腾讯 科隆 the
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论