新浪财经 6小时前
世界模型路线未定,资本却在疯狂投入
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

(来源:佩妮 Penny 的世界)

大家好,我是 Penny。

" 世界模型 " 可能是今年一级市场最热的词之一,聚集了非常多的资金。

每家公司都有自己的主线,对通往 AGI 的路线有不同的理解。语言文字是一种,视觉也是一种,如果我们要让智能走向现实世界,多模态能力是其中不可或缺的。

刚好,最近这个领域的新晋独角兽公司,智象未来(HiDream.ai),也刚刚宣布了完成 15 亿人民币的新一轮 C 轮融资。三个月内完成了三轮密集融资,累计融资超过了 21 亿人民币,跻身独角兽行列。

这轮融资由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本、创云海资本、华福投资、余杭金控股份、交银资本、若松基金多家机构跟投。

这个股东阵容,汇聚了社保基金、银行系、地方国资、头部产业资本,还有市场化的创投机构。

老股东也持续加注,像老股东合肥产投、东方富海、敦鸿资产这种,都连投了 2-3 轮。某种程度上也是一种资金共识和品牌背书的体现。

比较值得说的是像上影集团、华策影视这类头部影视行业的产业资本入局,有很大的未来合作想象空间。他们拥有庞大的 IP 库,制作团队和发行渠道,可以为 AI 视频生成模型提供真实的训练数据和应用场景。

不仅是个人的生产力工具,更是真正的深入走向产业。

而且,根据企查查信息,智象未来的合肥主体公司,近日已经变更为智象未来(合肥)科技股份有限公司,这说明随着 C 轮融资完成,公司已经悄然完成了主体公司的股改。

据我了解,这轮之后还有其他的融资,以及后续更进一步的资本市场运作也是在过程之中。头部这几家视频生成类公司应该都是处于竞速阶段,也许我们在今年年底或明年上半年就能看到更多好消息。

也就是说,不管大家对于这个行业的商业模式,技术路线和未来有着什么样的讨论,资本市场已经用资金投票,今后必然会诞生百亿甚至千亿级别上市公司。

智象未来创始人梅涛,之前是微软亚洲研究院视觉生成领域的资深研究员,是一位 AI 圈的重量级人物:加拿大工程院外籍院士,国内少数同时成为 ACM, IEEE, IAPR 和 CAAI 四大著名学会 Fellow 的国际知名人工智能学者。

2017 年,MIT 的教授发表了全球第一篇文生图论文,而与此同时,梅涛在微软微软亚研院带领团队,也完成了第一篇世界上当时最早探索文生视频方向的论文 TGANs-C,彼时距离 Sora 问世,还有整整七年。

直到今天,这篇论文的绝大部分作者目前仍然跟他一起在智象未来工作,一起从由视觉模型通向真实世界的未来而努力。

在过去几年,视频生成模型的进展非常迅猛,字节的 seedance ,快手的可灵,和多种多样的产品工具,一起已经成为了很多视频内容创作者最重要的生产资料。

一个视频创作者,用它把自己的脑洞变成了 AI 短剧和短视频。

一个电商运营,用它把自己的 SKU 生成了大量不同风格、人群、渠道的广告素材。

我上次去一个做 TikTok 代运营的朋友公司,他告诉我,他们团队已经能够稳定为品牌服务,一个月产出几千上万条的短视频,不管是投放效率还是转化都大大提升。

但是痛点依然是很明显的,token 很贵,抽卡靠运气,连续性和稳定性还不够。

过去两三年,绝大多数多模态模型,都是图片、语音、视频、文本分开处理,如同一个外接的视觉编码器,再加上大语言模型,

智象未来的大模型架构有所不同,他们自研了一套原生全模态架构 UiT(unified transformer)。从神经网络的最底层把图片、语音、视频、文本、3D 交互、动作等所有信号打碎成统一的 token,放在模型里一起训练。最终可以实现真正的 any to any,任意模态输入,任意模态输出。

模型不但能够理解这张图有什么,还能够预测它的时空、因果和物理上的反馈,这就从单纯的内容生成,走向了世界模型。

海外的头部玩家也在朝这个方向演进,包括 OpenAI、Google、Meta,还有 World Labs 等。

今年 5 月份,智象未来 HiDream-O1-Image 开源版本,登顶了全球独立模型评测平台 Artificial Analysis 文生图榜单开源模型的全球第一。6 月,商用版 HiDream-O1-Image-1.5 冲到全球第三、国产第一,仅次于 OpenAI 的两款图像生成模型。

前两天的上海 WAIC 大会上,智象未来发布了全球首款无限时长内容创作多模态智能体 vivago R1。

它和过去的视频生成模型最大的不同,不是把一段视频做得更炫,而是把视频生成从 " 单次出片 " 推进到了 " 长链路创作 "。

过去很多模型只能生成几十秒短片,画面可以很惊艳,但一旦内容变长,就容易出现人物变形、场景漂移、风格跳变、叙事断层等问题。vivago R1 要解决的,正是长视频创作里最难的三件事:无限时长、长任务思考和稳定生成。

所谓无限时长,并不是简单一次生成一部两小时电影,而是通过分段生成、统一编排和资产复用,让角色、道具、场景和风格在长周期创作中保持一致,故事可以持续往下延展。

它更像一个 AI 导演系统:先理解需求,再构思故事、拆分场景、锁定角色和美术风格,最后逐镜头生成并拼接成片。

这也是 vivago R1 真正值得关注的地方。它卖的不是某一个底层模型,而是模型之上的那层 Agent 编排能力——把创作者脑子里的一个想法,组织成一条可以交付的视频成片。对用户来说,最终重要的不是调用了哪个模型,而是任务有没有被稳定完成。

为了测试它的实际效果,我让它挑战在一个场景里完成几十年的跨度,人物要老去,但是手里的怀表得保持一致。

(这是 AI 根据我的描述自动生成的设计图 / 分镜脚本 & 视频)

最终的视频结果也令人惊艳,画质高清,故事流畅,主体保证了很优秀的一致性:

另外 vivago 还内置了很多场景类 skills,从文生图、图片融合到电商行业的一些广告素材、商品详情和 TVC,生成的素材可一键分享到 YouTube、TikTok 或者 X。

比如我随手给了他一张淘宝商品图片,Agent 就根据 Amazon 平台的标准,给我生成了一套从白底主图到商品详情页的动态展示图。

所有生成的图片视频还会沉淀在你的数字资产里面,可以重复使用。

大家也可以去玩一下!传送门:https://vivago.ai/

今年 Agent 行业的关键词都是 " 长 ",让 Agent 能够自主规划目标,完成长程任务,高成功率,低成本,这些才是金标准。

模型很重要,但是现在模型之上的那一层变得越来越重要。最终用户需要的是任务完成的结果。

这也是为什么,我觉得世界模型并不是一条和终极智能无关的岔路。

它可能不是所有公司通往 AGI 的必经之路,却可能是智能真正进入现实世界、创造商业价值的一条重要路径。

当模型能够稳定地理解和生成连续的世界,它未来可以进入影视、广告、电商、游戏,也可以进入自动驾驶、机器人、工业仿真和具身智能。

今天我们看到的是一条几十秒的视频,未来它生成的可能是一个可以被交互、被探索、甚至能够用于训练其他智能体的虚拟世界。

当然,这条路还有很多问题需要解决。算力成本能不能继续下降,长视频的一致性和可控性能不能真正达到产业标准,模型能力如何沉淀为可持续的收入,这些都决定了今天的百亿估值,未来究竟能不能变成一家百亿收入的公司。

世界模型是一个好生意,一家公司可以选择不做一个好生意,但市场不会放过一个好生意。

可以确定的是,这场由视觉模型通向真实世界的竞赛,已经从论文和 Demo,进入了资本、产品与产业同时加速的阶段。

而一个行业最值得关注的时刻,往往就是共识尚未完全形成,但变化已经开始发生的时候。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论