9 月 7 日,有消息称,字节跳动(以下简称字节)正在基于旗下视频生成模型 Seedance,开发一款实时空间视频生成模型。截至 9 月 9 日晚间,字节方面未对此作出官方回应,甚至有知情人士称,部分传言失实。
但比传言更值得追问的是,当世界模型成为全球科技巨头的必答题,字节会交白卷吗?
潮水的方向已然清晰。2025 年下半年起,OpenAI、谷歌、Meta、NVIDIA 相继入局世界模型;国内方面,腾讯开源混元 3D(三维)世界模型 2.0,阿里发布 HappyOyster 1.0。据《2026 世界模型专题研究报告》,今年前 7 个月,中国一级市场相关概念累计涌入资金 666 亿元,58 家企业获得融资,占赛道公司总量的 91%。
字节并非毫无准备。《每日经济新闻》记者梳理发现,字节已经发布视频生成模型 Seedance 2.5、视觉空间重建模型 Depth Anything 3、新一代 3D 生成大模型 Seed3D 2.0,甚至预计将在今年第四季度发布全新 VR(虚拟现实)头显 Pico Space Pro,再加上对影眸科技、生数科技、自变量机器人等的相关投资,字节一张 " 自研 + 投资 " 的世界模型拼图正在成形。
天使投资人、资深人工智能专家郭涛在接受记者采访时直言,字节的基本盘扎根于短视频算法推荐与海量图文视频内容生态,但这套能力集中于二维信息流,与实时交互、三维空间生成的世界模型存在 " 技术代差 "。如果字节主动放弃世界模型这条赛道,被下一代交互形态边缘化的风险较高。
郭涛也指出,世界模型尚处于技术路线并未完全收敛的早期阶段,对字节而言属于必须布局的前沿探索,但并非当下就要抢占的确定性入口。
字节的优势与短板
当 AI(人工智能)硬件与大模型加速迭代,直播、短剧、游戏等场景不断被重新定义,字节能否把手中散落的能力、业务拼成一张完整的版图,构建出 AI 时代新的竞争力,显然成为业界关注的焦点。
梳理字节已有版图,视频生成是其中最核心的部分。7 月 31 日,字节 Seed 团队发布 Seedance 2.5,单次原生生成时长从 15 秒提升至 30 秒,支持最多 50 个多模态参考素材同时输入,新增白模、绿幕参考能力。
火山引擎总裁谭待曾表示,世界模型流派很多,但视频生成是非常有效的一条,它不需要对数据做太多假设和采集,现有海量视频可以做大量无监督学习," 我们对这条路还是非常看好的 "。谭待透露,已有具身智能公司用 Seedance 做数据合成反哺模型。
光会生成视频还不够,世界模型的前提是理解空间。字节 Seed 团队去年发布视觉空间重建模型 Depth Anything 3,能从任意视觉输入中恢复三维几何结构。今年 4 月 23 日,Seed3D 2.0 发布,在几何生成、纹理材质生成两项核心指标上均取得 SOTA(当前最优)结果。
硬件入口上,字节 2021 年收购的 Pico 头显已被外界视为世界模型的重要交互终端。值得一提的是,Pico 一款全新 VR 头显通过美国联邦通信委员会认证,预计为将于第四季度登场的 Pico Space Pro。此前的 8 月 24 日,PICO-XR 官方宣布将发布时间由 9 月 2 日调整至第四季度,称在最后体验验证中看到了一个令人兴奋的全新机会,决定多花时间对软件体验做重大升级。
投资层面同样在卡位。字节已投资影眸科技、生数科技、未来不远机器人等,并领投自变量机器人 10 亿元 A++ 轮融资。而自变量机器人是国内唯一同时获得字节、美团、阿里三家巨头投资的具身智能企业。
被投企业也在密集推新。9 月 1 日,影眸科技发布世界生成模型 Hyper3D WorldGen,上传一张场景图片即可自动生成独立 3D 资产。此外,其 Rodin 模型上线 45 天即实现 100 万美元年经常性收入。未来不远机器人 5 月发布基于世界动作模型的新一代机器人大脑,让机器人具备物理推演能力,目前已启动第三代大脑研发。字节通过锦秋基金在机器人赛道累计投资超 10 笔,这些公司的仿真环境、机器人数据与世界模型形成互补。
字节 " 自研 + 投资 " 双轮驱动的全栈布局已然成形,但这套拼图最终要拼出什么?答案或许不在某一款产品。布局世界模型,对字节而言打开的不是单一功能,而是一整套交互逻辑的升级,基于二维信息流的内容形态都将被重新定义。
与此同时,腾讯、阿里等对手也已就位。
但郭涛分析,字节的优势足够明显:海量用户交互行为数据、短视频与实景视频素材能为世界模型训练提供丰富的原始数据,成熟的工程化落地能力与大规模算力调度经验有利于模型迭代与产品化验证。但字节同样具有短板:缺少机器人、虚拟现实场景的物理交互数据,物理仿真与三维底层算法积累相对薄弱,原有短视频内容生态不能直接平移复用至三维空间,人才储备与仿真工具链仍需补齐。
世界模型的冷思考
资本追捧与技术现实之间,横亘着一条尚难跨越的鸿沟。
在今年中关村论坛的圆桌会议上,耀途资本创始合伙人白宗义直言:" 现在不谈世界模型都不好意思融资,但只要涉及这个概念,估值就直奔亿美元级别。" 流形空间创始人武伟则警告:" 世界模型的定义正在被无限扩大,这与当年元宇宙概念炒作如出一辙。"
概念炒作之外,技术本身的成熟度同样值得审视。
今年 7 月,南洋理工大学 SLab 团队提出首个以物理定律为核心的视频模型评估基准,结果显示即使是 SOTA 模型得分也只有 0.473。研究指出,模型更多依赖表层视觉模式匹配,尚未形成稳定的物理状态建模能力,能生成看起来合理的画面,但并不真正理解物体为何会那样运动。
今年 1 月,谷歌 DeepMind 正式开放 Project Genie 公测,在 2026 年游戏开发者大会上披露的 Genie 3 真实能力是:初始版本只能在几秒钟内维持 3D 世界连贯性,升级后提升到大约 1 分钟。官方也承认生成的世界 " 可能看起来不够真实 ",角色控制存在延迟。
今年 6 月,北京智源人工智能研究院院长王仲远在一次群访中坦言,目前 4 种类型的世界模型距离真正能理解、预测、交互真实物理世界的基座模型,都还有非常大的差距,行业仍处于非常早期的阶段。
对于字节的双线布局,郭涛也从商业角度进行了分析。在他看来,该布局不以短期财务回报为首要目标,更多着眼于技术生态卡位和前沿技术情报收集。投资可以降低内部试错成本,观察外部技术路线演进,但内外协同、技术成果转化落地,仍是后续需要面对的现实挑战。
在时间窗口上,郭涛判断,综合产业迭代节奏,世界模型实现大规模可用需要 3 至 5 年。瓶颈突破不单依靠算法本身,还需要配套数据、仿真工具、硬件终端协同成熟,短期难达消费级普及。
但同时,如果字节主动放弃这条赛道,被下一代交互形态边缘化的风险较高。郭涛指出,字节当前的核心优势建立在信息流时代,AI 驱动的三维实时交互将重塑内容分发逻辑,属于技术驱动的范式变迁。即便现有短视频业务基本盘稳固,若缺席世界模型相关技术积累,未来在新型交互产品的竞争中将会丧失技术主动权,流量与生态优势会被逐步削弱。
每日经济新闻


登录后才可以发布评论哦
打开小程序可以发布评论哦