新浪财经 3小时前
字节京东布局世界模型,瞄准空间计算生态卡位
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

大模型学会聊天之后,开始学着「过日子」了。近日,京东把实时可交互世界模型 JoyAI-Echo WM 摆上开源社区;字节被曝把各模型方向中最高的资金投入,压向了同一个靶心。

AI「补课」物理常识,世界模型成了最贵的学分

世界模型内核朴素,让 AI 在脑子里装下世界的规律。杯子松手落地,拐角后有遮挡。语言模型熟读全部文字,却没端过一杯水,迈不进物理世界的跛脚就在这。

Genie 3 生成可探索环境,V-JEPA 2 做机器人规划,Cosmos 定位 Physical AI 底座。它早不该被归进视频生成赛道,视频生成只答下一帧,空间智能还得追问物体在哪、动作带来什么。

热度遮不住边界,视觉合理不等于物理准确,门看着能开,未必懂门轴和摩擦。

李飞飞拆解冷静,渲染、模拟、规划三位一体,最难啃的是模拟器。世界模型如今大致相当于 2019 年的语言模型,密码还没破。

冷静拦不住热钱,World Labs 融资 12.3 亿美元,估值 50 亿美元,英伟达与 AMD 罕见同框。

国内前 7 个月一级市场砸进 666 亿元,64 家公司 58 家拿到融资。

钱在抢跑,尺子还没造好,连世界模型都没共识,质变或许要等到 2028 年。收入那头,至今没人披露过规模化进账,技术还住在 demo 里,门票已开卖,行话叫期货。

可账本另一端诱人,IDC 测算中国具身机器人支出从 2025 年 14 亿美元蹿到 2030 年 770 亿美元,年复合增速 94%。国务院发展研究中心更乐观,预计 2035 年破万亿。

字节不缺模型,缺的是下一块屏幕

字节闯入世界模型的姿态很字节,承认来晚,然后加倍下注。

2024 年周畅从阿里通义加盟,内部判断路线未明,先打视频模型的仗。2025 年两支 VLA 成军,一路吃仿真数据,一路吃自然数据。

2026 年春节后牌桌重洗,Seed 新设世界模型研究组,前 Meta FAIR 研究员范浩奇挂帅,走 3D 仿真路线瞄准游戏娱乐,两支 VLA 合并归入周畅麾下,Seed Robotics 随后并入。

钱的流向更诚实,世界模型数据预算数千万元,是其他厂商的 3 到 4 倍。年底对标 Google Genie 3,差距约 10%。豆包 DAU 已破 2 亿,全球最肥的一块 AI 流量田。

字节的焦虑是结构性的,抖音把二维信息流做到注意力极限,用户时长和广告加载率都有物理上限,文本牌桌只排第 8,推荐引擎需要一块装得下下一次生命的新屏幕。

硬件是它交过学费的地方,2021 年 90 亿元抢下 Pico,2022 年 PICO 4 发布喊出销量破 100 万台。3 个月后 ChatGPT 出世,风向掉头,次年目标腰斩到 50 万台。2023 年二季度中国 VR/AR 头显只卖出 15.6 万台,同比减半。每一代头显的墓碑上刻着同一个死因,内容荒。

世界模型恰好能治这个病,Seedance 2.5 单次生成拉到 30 秒,可消化 50 个参考素材。Seed3D 2.0 输出带关节、可拆分、可进仿真引擎的 3D 资产,被称半个世界模型。9 月的目标参数值得咀嚼,端到端延迟约 50 毫秒,每秒约 20 帧,画面全部云端生成。

50 毫秒是一道门槛,人眼对延迟的容忍阈值在 50 到 100 毫秒,低于这道线,大脑会把虚拟空间误判为真实在场,VR 行业卡了 10 年。

云端生成顺手改写成本结构,头显只剩显示和传感,VR 从硬件生意变成云服务生意。原定 9 月的 Pico Space Pro 推迟到四季度,等的显然就是这口气。

把推荐引擎从二维屏幕搬进三维空间,让内容像自来水一样实时生成,内容荒这个老死因才被连根拔除。这与其说是技术野心,不如说是一个内容帝国的形态自救。

京东把供应链搬进了仿真器

京东做世界模型,画风与别家不同。这家公司的弹药库里没有日活神话,有的是别人抄不走的东西,20 多年供应链、60 万一线员工,和全中国密度最高的物理场景。

JDD 大会上,京东开源 JoyAI-Echo WM。它随用户移动持续生成场景,同步输出 720P 视频、环境音与语音,支持多轮交互,在 WBench Navigation 评测中以 81.6 分登顶。

模型只是水面上露出的尖,水面之下,京东计划两年采集超 1000 万小时人类真实场景视频,建设全球最大的具身智能数据采集中心,开源的行业最大第一视角数据集 EgoLive 覆盖 1969 类物体、1796 种动作,引来 8 个国家上百所高校申请。

这笔账算得清楚,机器人最贵的一课是摔跤,真实试错按小时计费,遥操作采集一小时动辄数万美元。仿真把摔跤搬进虚拟世界,成本趋近于电费。

京东恰好握着中国最完整的可仿真现实,仓库、分拣线、配送站、无人车,每天产出带动作标签的物理数据,这类数据在游戏视频里长不出来。

卡位动作密不透风,未来 5 年采购 300 万台机器人、100 万台无人车、10 万架无人机,全国布局 80 个 RoboBase 基地,JoyInside 牵手近 200 个硬件品牌,年内接入终端超千万台,投资名单从智元、逐际动力、众擎排到帕西尼,本体、零部件、具身模型全链条通吃。

这家公司在做一笔资产重估,把 20 年攒下的供应链从成本中心改写为 AI 时代的训练场。

入口是面子,收租权是里子

舆论爱讲入口之争,这个词值得拆开验货。

押宝头显入口,是 2016 年 VR 元年就演过的剧本。Vision Pro 卖了两年多仍是富人的玩具,Quest 守着小众盘子,Pico 刚从寒冬里缓过气。硬件这道门,还远远没装上。

卡位的真正对象,是空间计算时代的生产成本定义权。

字节押空间内容的生产成本趋零,内容荒消失后,它向内容产业收生成税。

京东押物理作业的试错成本趋零,机器人上岗前都在它的仿真里练手,它向机器人产业收仿真税。

两家排的是同一个售票处的两个窗口,卖的都是 2028 年的票。

生态动作都在为收租铺路,字节自研加投资,影眸科技、生数科技、自变量机器人陆续进了购物车。

京东投资加渠道加地产,200 多个品牌接入 JoyInside,80 个基地圈地,1000 万小时数据持续喂养模型。

两边的算盘都清楚,世界模型成熟那天,平台上跑着别人生意的那家,就成了事实标准。

软肋也该摆上桌面,字节的二维信息流与三维实时交互隔着技术代差,Pico 的前科提醒市场,这家公司的硬件耐心不算长。

京东场景全是自家的,数据闭环漂亮,可操作系统的价值取决于第三方数量,它的世界模型眼下最大的客户恐怕只有自己。

两家争夺的底层是同一种能力,持续的空间理解。字节握着模型、内容生态和终端,京东握着供应链、物流和可验证的物理场景,两家都还没有闭环。

拼模型像不像世界的阶段正在退潮,拼谁的世界装得下别人生意的阶段正在涨潮。

世界模型的战略价值,可能远超模型 API 本身。

部分资料参考:京东探索研究院:《From AI Models to the Physical World: Highlights from JDDiscovery 2026》,字节跳动 Seed:《Seed Research: BAGEL, The Open-Source Unified Multimodal Model, An All-in-One Model》,Meta AI Research:《V-JEPA 2: Advancing World Models for Physical AI》

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论