文 | 字母 AI
五年前,扎克伯格也曾兴冲冲地描绘过一个可以进去的数字世界。人们戴上 Quest,在里面见朋友、开会、看演出,甚至购物。Facebook 为此改名 Meta,Reality Labs 随后烧掉数百亿美元,Horizon Worlds 却始终没有成为大众产品。
那一轮 " 元宇宙 " 后来多少成了科技行业的笑话。可五年之后,张一鸣正在靠另一套技术,重新靠近一个很相似的未来。
在最新的传闻中,字节正在开发一款由张一鸣亲自督导的 " 世界模型 "。
Meta 当年从 VR 头显和 3D 世界起步,字节现在的起点是视频生成。Seedance 先把画面做出来,世界模型再让环境随着人的行动继续变化。更关键的是,抖音里本来就有直播,红果已经有几亿短剧用户,字节手里甚至还留着 Pico。
难道 " 元宇宙 " 并非痴人说梦,只是其缔造者注定另有其人?
01
试图想象一个可以直播购物、看短剧(甚至沉浸式进入短剧)的世界的时候,脑袋里总想起多年前小扎在 " 元宇宙 " 里漂浮的诡异半身。

那几年扎克伯格对元宇宙是真的很认真。
2021 年 10 月,Facebook 干脆把公司名字改成了 Meta。改名当天的 Connect 大会开了一个多小时,扎克伯格几乎是带着观众在未来世界里逛了一圈。
戴上 Quest,最先出现的是 Horizon Home。这里相当于虚拟世界里的家,朋友可以直接过来串门,一起看视频或者打游戏。上班则有 Horizon Workrooms,开会的人围着一张虚拟会议桌坐下,现实中的电脑屏幕也能搬进来。想看演唱会和 NBA,还有 Horizon Venues。
Meta 自己当时说元宇宙包括娱乐,但也要能工作、社交和学习,甚至连健身都算在里面。公司野心颇大,想把 VR 变成像手机、电脑一样的通用计算平台。
2021 年底 Horizon Worlds 向美国和加拿大 18 岁以上用户开放时,里面已经有数千个由创作者制作的世界。为了让更多人进来搞建设,Meta 专门拿出 1000 万美元成立 Creator Fund,还办创作比赛、提供现成模板,希望普通人也能跟着做。
第二年,商业变现的尝试陆续落地。Meta 允许一部分创作者在 Horizon Worlds 里出售虚拟物品和付费体验,逻辑其实和今天的内容平台差不多。
可惜,人和钱砸进去不少,元宇宙一直没有等来当年预想中的爆发。
Reality Labs 负责 Meta 的 VR、AR 硬件和相关软件,当然不能把它的亏损全部算在 Horizon Worlds 头上,但数字还是很吓人。2025 年,这个部门全年只收入 22.07 亿美元,营业亏损却达到 191.93 亿美元;今年上半年又亏掉 86.47 亿美元。
Meta 自己也慢慢没那么执着了。去年底,有媒体曝出公司准备在 2026 年砍掉最高 30% 的元宇宙预算。从 2020 年算起,Reality Labs 已经烧掉超过 600 亿美元。与此同时,Meta 现在更愿意谈 AI 和智能眼镜,元宇宙在公司里的位置明显往后退了。
这件事后来有很多解释。比如 VR 头显始终没有真正普及,戴久了也谈不上舒服。更现实的问题是,大多数人根本没有强烈到非要戴个头显去开会、逛街。
再比如这个 " 元宇宙 " 世界本身也太难造了。
TikTok 能有源源不断的新内容,一个重要原因就是拍视频的门槛足够低。手机掏出来,普通人当天就能发第一条。
Horizon Worlds 也一直号称普通人可以创作,简单的东西确实能靠现成组件拼出来。可稍微复杂一点,事情立刻变得专业。Meta 后来推出的桌面编辑器支持导入 Blender、Maya 做出来的 3D 模型,想给世界加上更复杂的互动,还要写 TypeScript。
这就很尴尬了。
Meta 费了很大劲把 Quest 卖给更多人,可这些人买回家以后,大部分还是消费者。让一个普通人拍条短视频不难,让他顺手给 Horizon 造个能玩的 3D 世界,完全是另一回事。
所以 Meta 后来一直没停过给开发者发钱、升级工具。到了 2025 年,公司甚至又拿出 5000 万美元扶持 Horizon 创作者。想让虚拟世界像短视频一样自己涌现海量内容,远没有当年想得那么容易。
02
如今情况已经发生变化。
去年 8 月,谷歌 DeepMind 发布 Genie 3 的时候,演示过一个很有意思的场景:给模型一句文字描述,它就能直接生成一个可以走进去的环境。

比如让它生成 " 古代雅典 ",屏幕里会出现大理石建筑和街道。用户往前走,画面跟着向前生成。转个弯再回来,刚才看到的树和建筑还大致留在原来的位置。谷歌还演示过火山、威尼斯水道、暴风雨中的佛罗里达海岸,这些地方都没有提前做成一张完整的 3D 地图,而是随着用户移动一帧一帧生成出来。
Genie 3 目前能做到 720P、每秒 24 帧,一个场景可以维持几分钟的一致性。离可以长期待在里面的虚拟世界当然还很远,但光看这套工作方式,已经和 Meta 当年很不一样了。
当年 Horizon Worlds 里的场景得先有人搭好。Genie 3 试着省掉这道工序,让模型随着用户的行动继续生成环境。
对用户来说,这个差别其实很好理解。
今天让 AI 生成一段 " 我骑着摩托车穿过东京街头 " 的视频,几十秒以后视频结束,东京也跟着没了。世界模型想做的事情麻烦得多——你骑到路口突然左转,模型得知道左边还有一条街。你停下来进一家店,它还得继续把店里面生成出来。过一会儿再走回原来的地方,最好别发现刚才那栋楼突然换了位置。
所以世界模型要解决的问题,已经不只是 " 画面像不像真的 ",它还得让这个虚构空间经得起人的折腾。
字节现在也在往这个方向摸索。
今年 2 月发布的 Seedance 2.0 已经把视频生成推进到了更复杂的运动和多人互动。字节自己特别强调了物理规律还原,比如人物之间发生接触、物体运动以后,画面尽量别出现以前 AI 视频里常见的穿模和乱飞。
8 月发布的 SeedRealtime 也很值得关注。

这个模型本身并不负责生成世界,它做的是持续看着眼前发生的事情,同时和人交流。镜头里出现新东西,模型可以主动发现。人在说话时指着某个物体,它也能结合画面理解你到底在说什么。换句话说,AI 开始能一直 " 待在现场 ",而不是等用户截一张图,再问一句 " 这是什么 "。
当下的最新报道,则看起来像是几条路线的一次交汇。
按照报道,张一鸣亲自督导的 " 世界模型 " 建立在 Seedance 之上,目标是让画面能够跟着用户的声音和动作实时变化,应用直接指向直播、短剧和游戏。生成主要放在云端进行,目标速度大约每秒 20 帧,延迟约 50 毫秒。字节目前并未公开回应该消息,也还没有公开展示这个模型,发布时间也可能变化,所以它到底能做到什么程度目前不得而知。
但这条路线已经很好理解了。
Seedance 擅长把东西生成出来,到了世界模型这里,生成出来的环境还得继续 " 活着 "。用户往哪走、做了什么,场景都要跟着变化。
而这恰好是五年前 Meta 造 Horizon 时最费劲的一部分。
更有意思的是,Meta 自己现在也绕回来 " 找补 " 了。
2025 年,Meta 给 Horizon Worlds 的桌面编辑器塞进了一批生成式 AI 工具。创作者可以让 AI 生成 3D 模型和纹理,也可以让它帮忙写 TypeScript、做天空背景和声音。Meta 当时给出的说法是,这些工具可以把一些原本需要几周的开发工作缩短到几小时。后来又继续加入环境生成,希望创作者最终只需要写几句提示词,就能搭出一个完整世界。

这个变化多少有点微妙。
这其实也说明,Meta 当年遇到的那个问题,到今天仍然存在,只是解决办法变了。
当虚拟空间的生产开始越来越像生成图片、生成视频,元宇宙当年那道最麻烦的门槛,才第一次有可能真正往下降。
03
造世界的门槛如果真的降下来,里面放什么?这一点字节倒不太缺答案。
最容易想到的就是直播。最新报道里,直播本来就是这款空间视频模型计划探索的场景之一。抖音的直播生意生猛,今年 618 期间,超过 12 万商家的直播成交额同比翻倍,带货成交额翻倍的达人超过 57 万。
直播放入 " 元宇宙 " 里的情形不难想象。比如一个旅行主播不用一直举着手机带观众逛,直播间本身就可以生成一个能活动的目的地,观众可以自己四处看看。卖家具也可以直接生成一套房子,让用户看看沙发放进自己喜欢的装修风格是什么效果。
短剧也有类似的想象空间。
字节现在手里已经有相当庞大的短剧规模。QuestMobile 数据显示,今年 5 月,红果免费短剧月活达到 3.56 亿。今年 2 月,用户日均使用时长已经达到 125 分钟。
这些内容目前还是标准的视频逻辑。可一旦生成模型能够稳定维持一个空间,短剧就不一定非得把所有东西提前框定死。一个悬疑故事里,观众也许可以自己走进案发现场,甚至想跟着另一个人物离开,模型就继续生成那条支线。
我们距离这样自由的虚拟空间还有一些距离。目前世界模型首先得解决人物和场景的一致性,还得把成本和延迟降下来。
不过字节已经开始发力。根据 36 氪在 6 月的报道,今年世界模型被列为字节 AI 的四个重点方向之一,内部同时在探索 3D 模拟路线。游戏业务也重新出现 AI 项目,5 月公布的《不问凡尘》就把 AI 驱动的影视化叙事当成卖点。
字节内部还有另一条大众更熟悉的 AI 产品路线,豆包就是最典型的例子。
豆包已经是字节最重要的 AI 产品之一。QuestMobile 数据显示,今年 6 月它的月活达到 3.82 亿;6 月 24 日,豆包又正式上线专业版,最低连续包月 68 元,开始认真探索付费。此前还有报道称,豆包准备进一步接入抖音电商。
但一个 AI 助手怎么和字节原来的生意结合,多少还是得重新琢磨。收费是一种办法,接入电商也是一种办法,可用户在豆包里问问题,和他在抖音里刷视频、看直播,本来就是两套不同的使用习惯。
世界模型如果真的改变了视频这种内容本身,很多连接甚至不用专门设计出来。直播间可以继续卖货,短剧仍然是内容消费,只是原来隔着屏幕看的东西慢慢有了更多交互。
再加上 Pico,这个想象就更完整一点。
字节并没有因为 VR 行业降温把 Pico 扔掉。今年 PICO Space Pro 原本计划 9 月发布,后来宣布推迟到第四季度,官方给出的原因是还要做一次较大的软件体验升级。
所以最新报道里的那个空间,短期完全可以先存在于普通屏幕里。技术真的发展到需要更强的沉浸感,字节手里至少还有一套自己的 VR 硬件。
这也是世界模型对字节很诱人的地方。
它到底是不是通往 AGI 的重要路线,现在没人能下定论。可字节并不一定非得等这个问题有答案。哪怕最后只做成一种更复杂、更实时的视频形态,抖音、红果这些产品也已经提供了足够大的试验场。


登录后才可以发布评论哦
打开小程序可以发布评论哦