甲子光年 昨天
阿里Wan3.0,向生产力工具再进一大步
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

稳定可用是创作者们不变的刚需。

作者|刘杨楠

作者|栗子

8 月 6 日,阿里巴巴全新一代视频生成模型 Wan3.0 开启公测。

从官方披露的信息看,这次升级覆盖生成时长、万能创作 + 全能参考与真实感三个维度——

单次可生成 30 秒视频,让连续运镜、一镜到底等复杂镜头语言得以完整表达;万能创作打通文本、图片、音频、视频多模态输入,并首次支持 doc、xls、ppt、pdf、md 等结构化文档;全能参考任务中,角色、道具、声音、空间关系与风格等细粒度维度可稳定保持;真实世界还原能力提升,人物力求 " 千人千面 ",每一帧画面既真实又可信。

这三个维度的升级,几乎逐条对应了当前 AI 视频生产的几道顽固痛点——生成时长不足、读不懂结构化信息、跨镜头一致性差、对真实世界的还原失真。

长期以来,视频生成模型更像一个碎片化的片段生成器,能产出几秒惊艳的镜头,却难以承担完整叙事与稳定商用。Wan3.0 试图回应的,正是视频模型能否从玩具走向真正的生产力工具这个核心痛点。

不过,创作者们大可放心,和强悍能力 " 不相匹配 " 的是 Wan3.0 的亲民价格。Wan3.0 三档分辨率 480P、720P、1080P 对应 0.3、0.6、1.2 元每秒的 API 定价,API 接口也将于近期全量开放。

1.AI 真正读懂真实世界

具体来看,Wan3.0 将 " 读懂真实世界 " 拆解为几个可观测的侧面,包括能否理解结构化信息、能否还原真实人物的差异、能否在镜头变换中守住一致性、能否真正用视频还原想象世界。这几个侧面,也正对应着 AI 视频最难啃的几块骨头。

   一份 PPT 生成一支产品创意宣传片

上传一份智能眼镜产品的 PPT,配一句提示词,Wan3.0 即可生成一支高端智能眼镜的产品短片。成片在极简风、未来感的视觉风格上做得很到位,光影克制,以黑

、银灰、冰蓝为主色调。

这件事的难度不在画面本身,而在输入的复杂性。PPT 并非一张图片,它承载着层级、版式与数据关系,产品参数、卖点结构、图文排布共同构成一套语义。多数视频模型只能识别画面,对画面中涵盖的结构化信息束手无策,拿到 PPT 也只能照参考图拼凑,输出与原文件难以对应。

Wan3.0 支持 doc、xls、ppt、pdf、md 等格式,单文件或链接不超过 100MB、50 页,其处理逻辑模型强大的提示词工程与指令遵循能力,模型能够充分理解各种输入格式,将提示词转化为调度输入、实现功能、控制表达的中枢。

这一步的意义,是让视频生成的输入内容从一句话、一张图扩展到一整份现成资料,模型的角色也真正从单纯的内容生成器转向信息的表达载体。在办公素材能否直接成为视频输入这一点上,Wan3.0 与多数同类模型拉开了身位。

   堪比人类的真情流露

这段 15 秒的电影级镜头,两位人物动线流畅,且女主的情绪连贯、自然,从这个片段中已经能够大致脑补出一个完整的故事情节。

此前,AI 生成的人物长期被一种 " 标准脸 " 困扰,AI 人物的五官比例不偏不倚,皮肤毫无瑕疵,但眼神空洞,换发型易、换骨相难。此外还有一致性压力,模型须在画面切换之间,将人物面貌、衣着、光影与空间关系连贯地衔接,中途不能换脸或穿帮。

Wan3.0 则在皮肤五官的克制还原、情绪的收敛表达、微表情与肢体的联动上做细,使人物经得起近景审视。

   科幻感十足的机甲大战

这个 30 秒的短片几乎做到了真假难辨的程度。画面是科幻战争史诗,未来城市废墟,巨型机甲对战,高清晰度的超写实画面,其中包含多次视角切换。

长镜头最怕中段崩坏,例如角色中途换脸、道具位置错乱、空间关系前后矛盾等。业界不少模型在生成超过 10 秒后便开始漂移,而 30 秒的时长叠加一次主动视角切换,等于在一致性上又加了一重考验。

Wan3.0 在跨镜头层面将角色、道具、声场、空间与风格同时稳住,视角的切换服务于叙事、保持可控,没有失控失真,摆脱了 " 抽卡 " 的不确定性,这正是 AI 在长视频与品牌商用等场景下得以成立的前提。

   凯旋门上长出的粉色毛绒蛋糕

现实与动画交汇的一组里,一条 6 秒的短片把 " 读懂真实世界 " 推向了更具想象力的边界。画面是真实的巴黎城市航拍,一座巨大的粉色毛绒蛋糕从凯旋门顶部跳了出来。

现实与幻想并置,最易两头落空,要么虚假失真,要么想象被现实压垮。难处在于,既要守住真实场景的摄影质感,又要让超现实元素自然成立。

而 Wan3.0 的成片中,巴黎的城市肌理保留了真实地理的质感,而粉色毛绒蛋糕这一超现实元素则被自然地嵌入真实空间。

真实场景的高保真还原,与风格化元素的干净植入之间,依靠融合达成,看不到生硬拼接的痕迹。这种在真实与想象之间自由调度的能力,让 Wan3.0 在广告、文旅与创意短片领域具备了差异化的发挥空间。

   东方仙山秘境

这个长达 30 秒的国风动画中包含 9 个镜头切换,把一致性放在了风格化叙事的极端条件下检验。全片走风格化路线,美学参照新国潮月份牌插画,以粗细均匀的传统工笔为语言,配乐也和画面意境高度吻合。

其中,九个镜头意味着九次切换,镜头越多,风格越易飘移,角色走样、场景跳脱、色调前后不一等问题困扰着很多创作者。而风格化程度越高,跨镜头保持统一就越难,一旦失稳便格外醒目。

Wan3.0 在多镜头切换总下将风格、元素与色调稳住,说明其一致性不仅作用于写实场景,在高度风格化的叙事中同样成立。这对国风、动画等强调视觉统一性的内容形态,是关键的能力底座。

2. 向生产力工具再近一步

这几条 demo 合在一起看,Wan3.0 生成视频的能力边界和深度均大幅拓展,让 AI 规模化落地视频创作领域的三个关键卡点都有了解法。

首先,Wan3.0 读懂结构化信息的突破,填补了一个行业空白。

文档的层级、版式与数据关系,要求模型充分理解画面背后的语义信息,才能转化为视频,其底层依赖的是提示词工程与指令遵循能力。

这块空白一旦补上,本质上是拓展了视频生成模型输入端的边界。过去视频生成的输入端极为贫瘠,仅限一句提示词或一张参考图。万相把大量现成的办公素材、产品资料、教学讲义,都能直接成为视频生成的输入,等于为视频模型接上了一座现成的信息矿,视频创作的效率大幅提升。

其次,Wan3.0 对人物的真实还原也做了很多优化。

目前大量 AI 短剧 " 千人一面 " 的问题已经引起很多观众的反感,根因在于模型对 " 人 " 的理解太过刻板,只能复现某种诡异的平均长相。

Wan3.0 此次升级直指这一症结,皮肤与五官的细节、情绪的克制、微表情与肢体的联动,把人物从恐怖谷里拉出来,把此前精确但死板的面孔变成一个有血有肉的人物。

「甲子光年」发现,Wan3.0 在这一方向的成绩并非一蹴而就。从 Wan2.2-Animate 对角色动作与表情的重塑,到 Wan3.0 对五官皮肤细节与情绪表达的细化,Wan 系列一直在追求人物表情的真实和灵动。

对照前代,当一张脸能保留毛孔、雀斑与骨骼走势,不再滑向磨皮后的失真," 千人千面 " 才从口号落到画面。

最后则是对长视频而言及其重要的一致性。

在所有场景的视频创作中,角色、道具、声音、空间关系与风格,须在跨镜头间保持稳定,这是长视频真正商用的前提。

一支广告里产品标识前后不一、人物中途换脸,商业价值便直接归零。Wan3.0 在 30 秒长镜头、多镜头切换上的稳定输出,让一致性真正稳定可预期。

回看 Wan2.2 引入的 " 电影美学控制系统 ",便能理解 Wan3.0 这种稳定性源自架构与训练的长期打磨。

需要客观指出的是,阿里自身也承认,当前 Wan3.0 在声音质感与文字准确度上仍有进步空间。但 Wan3.0 此次升级,已经能让视频模型从玩具向生产力工具迈出一大步。

影视层面,30 秒时长、真实还原与跨镜头一致三者齐备,AI 影视、短漫剧、MV 与 Vlog 才具备以更低成本产出作品而非 demo 的条件。

广告层面,万能创作使创意可直接成片,文本、图片、音频、视频皆可作参考,契合家电、彩妆、汽车、快消等行业批量定制素材的需求。一份产品资料进入,一组风格统一的形象片产出,上新与投流的节奏随之加快。

设计层面,UI 演示、功能动画与数据可视化,得以在保留审美的前提下从静态交付转为动态叙事,让设计师直接交付一段会动的说明,大幅减少从业者的工作量。

文旅层面,真实场景的还原能力使大规模实拍不再是必需,城市形象片与地标短片可低成本产出,叠加真实与想象同帧的融合能力,文旅传播的创作空间被进一步打开。

当前,各行业创作者们对 AI 视频的核心诉求已经不满于单纯抽卡碰运气,真正稳定可商用是创作者们不变的刚需。而目前很多模型虽然在效果层面不断逼近上限,但人物刻画、理解结构化信息、一致性与真实还原等方面均有不同程度的短板,限制着模型在真实场景的落地效果。

Wan3.0 试图回答的,正是 AI 视频能否从生成片段的玩具,走向能进入各行各业视频生产工作流的工具。当模型学会 " 千人千面 ",读得懂结构化的世界,同时能撑得住一段连贯合理的故事,AI 视频才算真正贴合 " 万相 " 这个名字。

(封面图来源:阿里万相)

END.

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

阿里巴巴 ai
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论