编译 | 杨蕊伃
编辑 | 漠影
智东西 10 月 11 日消息,据 VentureBeat 报道,北京大学、北京邮电大学和快手科技在本周联合开源了一款名为 Pyramid Flow 的高清视频生成模型。Pyramid Flow 能根据文本描述制作长达 10 秒、分辨率为 1280×768、每秒 24 帧的视频。
Pyramid Flow 采用了金字塔流匹配算法,优化了视频生成的效率和质量。这一算法将视频生成过程分解为多个阶段,每个阶段对应着不同的分辨率。
在推理阶段,Pyramid Flow 模型能够以相当快的速度生成视频。具体来说,它可以在 56 秒内生成一段时长为 5 秒、分辨率为 384p 的视频,这一速度与市面上许多全序列扩散模型相当,甚至更快。
目前,该项目已经在 Hugging Face 和 GitHub 上开源。
开源地址:
1、https://github.com/jy0205/Pyramid-Flow
2、https://huggingface.co/rain1011/pyramid-flow-sd3
一、金字塔流匹配算法:高质量 AI 视频新技术,逐层提高分辨率
文生视频领域有一个非常难的技术挑战,就是如何有效地处理和生成高维度的视频数据。
针对这一技术挑战,Pyramid Flow 研发团队提出了金字塔流匹配算法。
金字塔流匹配算法的核心思想是将视频生成过程分解为多个阶段来有效处理高维度的视频数据。这些阶段从低分辨率开始,逐步升级到高分辨率,从而逐步提升视频的清晰度。
这个过程就像是先画一个简单的草图,然后一点点地加上颜色和细节,直到画出一幅完整的画。
▲金字塔流匹配算法:视频的生成是在不同的分辨率层次上逐步进行的(图源:arxiv 论文截图)
二、开源数据集训练,Pyramid Flow 生成 5-10 秒高清视频
Pyramid Flow 模型通过分阶段的方式生成视频,大大减少了计算成本。
▲ Pyramid Flow 生成的视频展示(图源:Pyramid Flow 官网)
与传统的扩散模型相比,Pyramid Flow 的金字塔流匹配算法将 token 数量减少了 4 倍。
▲ Pyramid Flow 生成的视频展示(图源:Pyramid Flow 官网)
据官网介绍,该模型可以在 768p 分辨率和每秒 24 帧的条件下生成 5 至 10 秒的视频,并且是基于开源数据集进行训练的。
▲ Pyramid Flow 生成的视频展示(图源:Pyramid Flow 官网)
具体来说,Pyramid Flow 在训练时用到的数据集包括 LAION-5B、CC-12M、SA-1B 以及 WebVid-10M 和 OpenVid-1M 等。
1、LAION-5B:一个用于多模态 AI 研究的大型数据集。
2、CC-12M:一个由网络爬虫收集的图像文本对的数据集。
3、SA-1B:具有高质量、无模糊图像的数据集。
4、WebVid-10M 和 OpenVid-1M:两个被广泛用于文本到视频生成的视频数据集。
三、宽松许可,Pyramid Flow 开源商业用途,轻松实现视频微调
Pyramid Flow 是开源的 AI 视频生成工具,它允许用户用在商业项目里,但须保留版权声明。
▲ Pyramid Flow 生成的视频展示(图源:Pyramid Flow 官网)
通过使用 Pyramid Flow,用户可以免费调整视频细节,这项功能对于电影制片厂来说很有吸引力。
电影制片厂可以通过使用 Pyramid Flow 来提高视频制作效率、降低视频制作成本,并探索新的视频创意工具。
不过,要想充分利用好这一模型,电影制片厂还需要具备一定的开发人才和计算资源。
目前,Pyramid Flow 缺乏像 Runway Gen-3 Alpha 这样的模型所具备的一些高级微调功能,比如精确控制摄像机角度、关键帧和人体姿态等电影元素。
▲ Pyramid Flow 生成的视频展示(图源:Pyramid Flow 官网)
▲ Pyramid Flow 生成的视频展示(图源:Pyramid Flow 官网)
▲ Pyramid Flow 生成的视频展示(图源:Pyramid Flow 官网)
来源:VentureBeat、Pyramid Flow 官网、arxiv
登录后才可以发布评论哦
打开小程序可以发布评论哦