技术视觉 3小时前
京东开源实时视频交互模型,蚂蚁发布原生多模态大模型!AI 从"一问一答"走向"边看边说"
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

核心内容:蚂蚁集团推出并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL,引入视觉反馈闭环机制。京东开源实时视频视觉语言交互模型 JoyAI-VL-Interaction,为全球首个全栈开源的 interaction 模型和系统,让大模型从 " 一问一答 " 走向 " 边看边说 "。

当 AI 学会一直在看、该说才说,交互才真正开始。

9 月 9 日,两件事在 AI 圈几乎同时发生:蚂蚁集团发布并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL;京东在全球科技探索者大会上,集中展示了实时视频交互模型 JoyAI-VL-Interaction 的落地应用。

两家公司做的事情不同——蚂蚁开源模型,京东开源系统——但指向同一个方向:让 AI 从 " 等提问 " 变成 " 持续在场 "。

这或许是多模态赛道最值得关注的一个拐点:当模型不再需要你按下 " 发送 " 才开始工作,人机交互的方式将被重新定义。这篇我们拆四件事:两家分别做了什么、交互范式到底变了什么、背后的技术关键词是什么、以及 " 边看边说 " 离我们还有多远。

01 两件大事:蚂蚁开模型,京东开系统

先分别看两家做了什么。

蚂蚁这边,发布的是 Ling-3.0-flash-VL:百灵系列首个原生多模态大模型,基于 MoE 架构,总参数 124B、单次推理只激活约 5.5B,原生支持图像、文本与视频三种输入,上下文窗口最高 256K Token。它已经在 Ling Studio 免费开放体验,并在主流开源社区上线了 BF16/FP8 权重。

京东这边,主角是 JoyAI-VL-Interaction:一个 8B 规模、以视觉为核心的实时交互模型,被官方定义为全球首个全栈开源的 interaction 模型和系统——模型权重、训练方法、数据、完整可部署系统全部开放,还拿到了 vLLM-Omni 的 day-0 原生支持。

一个细节值得注意:蚂蚁强调 " 原生多模态 ",京东强调 " 全栈开源 "。前者拼架构,后者拼工程——但两家大厂在同一天把筹码压在了同一个方向上。

02 交互范式的转变:从 " 对讲机 " 到 " 同行的伙伴 "

要理解这次变化,先看传统多模态模型的工作方式。

过去的大模型基本是 " 对讲机 " 模式:你提问,它回答;你不问,它就不动。哪怕模型能 " 看懂 " 图片、视频,也必须等一个明确的指令才开始处理——这种 " 轮次制 " 交互,天然漏掉了真实世界里大量稍纵即逝的信息。

" 边看边说 " 改变的是这件事:模型持续观察视频流,自己判断什么时候该说话、什么时候该保持沉默、什么时候该把任务委托给其他系统。以京东 JoyAI-VL-Interaction 为例,它能对来自摄像头、直播或监控的连续视频做实时理解,响应压到亚秒级,而且什么时候开口、什么时候闭嘴,是模型自己学的,不需要外部触发。

你可以把它理解成从 " 对讲机 " 换成了 " 同行的伙伴 ":它一直在场,该提醒时提醒,该安静时安静。

03 两个技术关键词:视觉反馈闭环 vs 一体化交互决策

做完会回头看、错了就修正,这是从看懂走向做对的关键一步。

两家的技术路径各有侧重,但都指向同一个共识:视觉要成为 " 执行过程中的校验器 ",而不只是 " 输入格式 "。

蚂蚁的关键词是 " 视觉反馈闭环机制 "。它把任务推进拆成 " 观察、行动、验证、修正 " 的持续闭环:模型执行一步,回头看结果,发现不对就修正再走。官方公布的目标场景包括医疗报告解读、前端代码生成、GUI 自动化——这些场景的共同点是 " 干完活要检查效果 ",视觉反馈正好用来做这个检查。

京东的关键词是 " 一体化交互决策 "。JoyAI-VL-Interaction 把感知、推理和交互决策融进同一个模型,而不是在外面挂一堆检测器和规则引擎;通过异步双环推理机制解决 " 实时看 " 和 " 深度想 " 之间的矛盾,用逐秒时间对齐的数据配合强化学习,让模型学会 " 何时开口 "。

一句话总结:蚂蚁让模型 " 做完会回头检查 ",京东让模型 " 看着就能自己决定怎么做 "。

04 为什么是现在:实时交互的工程拐点

" 边看边说 " 不是新概念,为什么现在才成为现实?背后是三个变量的同时成熟。

第一,延迟被打下来了。实时交互的生死线是延迟——过去 " 看视频再回答 " 要好几秒,现在京东的公开方案已经做到亚秒级响应。第二,成本被小模型打下来了。8B 参数、激活 5.5B 这类轻量规格,意味着实时视觉交互可以跑在相对普通的硬件上,而不是只属于大厂机房。第三,全栈开源把门槛拆掉了。模型、数据、训练方法、部署系统全部开放,开发者拿到的是 " 整套可运行的方案 ",而不是一个需要自己摸索的黑盒。

当这三个变量同时到位,一个品类的爆发就有了基础设施。

05 场景已经长出来了:眼镜、直播、监控、实时翻译

最需要边看边说的,恰恰是那些画面稍纵即逝的真实场景。

更值得注意的是,应用场景不是 PPT 上的想象,而是已经开始落地。

最典型的是 AI 眼镜。在京东 JDD 大会上展示的场景里,接入 JoyAI-VL-Interaction 的 AI 眼镜不再等用户提问:走到路口,它会主动提示来车;用户迷路,它主动给出方向——这种 " 主动看见、自主判断 " 的能力,对视力障碍人群尤其有价值。

其他场景也在铺开:直播间的实时互动与讲解、监控画面的异常预警、会议的实时转译、教学场景里对着幻灯片即兴讲解。京东官方给出的能力描述里甚至包括 " 引导购物者切换 App 界面 " 和 " 对着幻灯片即兴开讲 " 这类此前从未专门训练过、却自然涌现的能力。

一个共同点:这些场景全部是 " 持续存在 " 的场景——画面一直在,关键事件稍纵即逝,只有 " 一直看着 " 的模型才能接住。

06 判断框架:怎么判断 " 边看边说 " 值不值得跟进

对开发者和从业者来说,这个方向值不值得投入,可以用三个变量判断。

第一,实时性。交互延迟是否到了亚秒级?如果模型 " 看完再答 " 要好几秒," 边看边说 " 就只是概念。

第二,主动性。模型是自主决定开口时机,还是依赖外部触发器?真正的范式变化,在于 " 何时说话 " 是模型内部学会的决策,而不是轮询或规则。

第三,可部署性。能不能在普通硬件上跑起来、有没有完整的开源方案?只有能自部署的 " 边看边说 ",才谈得上规模化。

07 边界:边看边说还有很长的路

最后说边界。方向明确,不等于立刻成熟。

其一,持续视频理解的算力成本仍然不低,长时运行、多路并发的真实部署成本需要验证。其二," 持续在场 " 意味着持续采集视觉数据,摄像头、监控、眼镜带来的隐私与合规问题,会是这个品类绕不开的关卡。其三,主动开口是把双刃剑——判断错了时机、说了不该说的话,体验损失比 " 问而不答 " 更严重,可靠性还需要长期打磨。其四,蚂蚁的模型与京东的系统都还在早期,第三方大规模复现与评测仍需时间。

更稳妥的说法是:两家大厂在同一天押注,说明 " 边看边说 " 已经从论文走向产品化,但它能否成为主流交互范式,还要看成本、隐私和可靠性这三关怎么过。

所以,该怎么看待这次 " 同日加码 "?

一个比较清醒的判断是:多模态的下一个竞争点,可能不是 " 模型能看得多清楚 ",而是 " 模型能不能一直在看、并且该说才说 "。

当 AI 从 " 你问它答 " 变成 " 持续在场 ",改变的将不只是模型的能力表,而是所有依赖 " 提问 - 回答 " 设计的产品逻辑。对开发者来说,这既是新的工程挑战,也可能是下一批产品机会的起点。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

开源 京东 蚂蚁集团 拐点
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论