Z Finance 16小时前
视频版 GPT-Live 来了,形界智能发布 Genesis-1.0,面向长时、智能的 AI 互动娱乐基础设施
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

今年   7   月,OpenAI   发布   GPT-Live。相比过去一问一答式的语音助手,其核心突破不仅在于更自然的拟真音色,更在于把   AI   的交互方式从 " 回合制 " 推向了真正的实时对话:模型具备边说边听的全双工能力,支持随时打断,甚至懂得在恰当的时机保持沉默;遇到复杂推理和工具调用时,再把任务交给后台模型处理,而不需要让当前对话停下来。OpenAI   当时披露,每周已经有超过   1.5   亿人通过   Voice、Dictation   等语音功能和   ChatGPT   交互。

这件事带来的一个直观变化是,人开始更愿意和   AI   进行更长时间、更高频率的持续互动。

文字聊天天然是一种 " 输入—回答 " 的离散交互,语音则更接近现实中的持续交流。而当交互形式继续从   Voice   走向   Video,问题会再往前一步:AI   不仅要一直听着,还要一直 " 看着 "。

用户正在说话还是已经停下来,脸上的表情是什么,突然挥了挥手还是比了一个心,甚至一句话都没有说,只是移开视线——这些没有进入文字和语音的信息,本身就是人与人交流的一部分。

9   月   18   日,成立不到四个月的形界智能(Frame-X)计划正式发布   Genesis-1.0,并向用户开放体验   24   小时   AI   直播。形界把它定位为一套面向   AI   社交、陪伴和互动娱乐的视频双工模型。

相比今年   7   月在   WAIC   首次亮相的   Genesis,1.0   版本给出了一组更接近产品化的数字:连续生成超过   24   小时,画面行为响应平均   1.5   秒,最快可达到   1.2   秒,支持全身动作,调用价格为每秒   0.003   美元。

放到今天的实时   Avatar   市场里,这组参数已经颇具进攻性。Runway Characters   的   API   单次会话最长为   5   分钟;HeyGen LiveAvatar   根据不同产品层级,单次会话上限从   5   分钟到   60   分钟不等;另一家实时视频公司   Vivix   推出的   A1,则把能力进一步扩展到全身动作与开放世界交互,并持续响应新的用户输入。

图片来源:Frame-X

但   24   小时、1.5   秒这些数字并不是   Genesis-1.0   真正想讲的故事。

形界把一个面向社交的   AI   角色需要具备的基本能力归结成两件事:它能不能一直在,以及它是不是真的看得到你。前者要求模型长期维持一个稳定的角色和世界;后一个问题则更接近真实社交的本质—— AI   不仅要听懂用户说了什么,还要持续读取人的表情、动作、姿态乃至沉默,把这些非语言信号一并纳入交互。只有做到这一步,视频才不只是给用户看的输出,而真正成为模型类人感行为输出的另一条通道。

长时一致性大考:24   小时不宕机背后的 " 世界维持 " 能力

今天绝大多数   AI   视频仍然是一种有终点的内容。

用户输入一句提示词,模型生成几秒或者几十秒的视频,任务就结束了。但实时交互视频没有天然的终点,它更像一场不会提前写好剧本的直播,用户可能随时改变动作、说一句话、拿起一个物体,甚至突然离开镜头。视频必须根据已经发生的一切实时演算继续向前生成。

这也带来了实时视频最棘手的问题之一——误差累积

实时视频生成采用   Auto-Regressive(AR)方式连续生成,模型刚刚生成的结果很快会成为下一轮生成的上下文。一次很小的偏差,如果没有被纠正,就可能不断传下去:先是人物五官稍微变化,接着衣服颜色漂移、物体消失、空间结构变形,最后连人物和环境之间原本成立的关系都逐渐失真。

所以,当生成时间从几十秒拉长到几十分钟甚至数小时,真正关键的问题在于画面的一致性——生成到足够久以后,模型还知不知道这个世界现在的确切状态。

Genesis-1.0   此次针对长时误差累积与生成一致性问题进行了专项优化,将业界约  5   分钟级的互动时长,提升至稳定的   24   小时

但   24   小时本身并不是重点。它更像一次压力测试,测试模型在经过成千上万轮连续生成之后,角色身份、场景结构和已经发生过的状态变化能否继续被模型正确继承。

这和大语言模型的长上下文能力有些相似。长上下文的关键并不是简单 " 读得更长 ",而是在经历大量历史以后,仍然知道哪些信息和当前有关。放到视频里,就是运行足够久之后,模型仍要知道谁是谁、东西在哪里、此前发生过什么,以及下一刻有哪些状态要保持连续。

如何解决这一问题,行业正在出现不同的技术路线。

一种典型思路是   3D / Spatial   路线:在视频之外显式保存空间结构、物体状态和历史记忆。世界的结构由一套结构化状态负责维护,而视频模型更像一个翻译器,负责把它渲染成画面。对于游戏、仿真等要求精确空间关系的场景,这是一条非常自然的技术路线。

但形界押注的是另一种选择:让视频模型自己学习和维护世界状态。

它希望人物身份、空间关系和历史变化直接沉淀在模型学习到的视频表征中,而不是随着世界越来越复杂,在模型之外同步增加一套越来越庞大的状态系统。

这背后是一种更彻底的   Scaling   假设:如果世界的结构、状态和变化规律本身可以被视频模型学习,那么随着模型规模、数据规模和训练规模增加,模型能够在同一种表征中不断吸收更复杂的世界知识。相比之下,一旦把大量状态显式放在模型之外,世界复杂度上升时,外部结构化表示也需要同步变得更加复杂。

换句话说,形界希望把 " 记住世界 " 也逐渐变成模型能力本身,而不是长期依靠模型之外的一套工程系统兜底。

这当然还不是一场已经有定论的路线之争。显式   3D   状态在许多场景中有不可替代的确定性优势,而一次   24   小时实验也不足以证明视频表征能够解决所有长期记忆问题。

但   Genesis-1.0   至少把这个原本偏研究的问题向前推进了一步:互动视频开始从" 不断生成下一段内容 ",走向" 持续维护一个正在运行的状态 "。更值得注意的是它的迭代速度:从今年   7   月   Genesis   在   WAIC   首次公开亮相,到   Genesis-1.0   把连续生成推到   7x24   小时,中间只隔了两个月。

告别 " 套皮数字人 ",端到端行为推理创造真正的 " 类人感 "

不过,对于   Genesis-1.0   来说,长时稳定只是一层地基。如果一个角色能够在屏幕里稳定存在   24   小时,却对屏幕外用户的举动毫无察觉,它仍然只是一张无限延长的动态壁纸。

过去几年,数字人在 " 长得像人 " 这件事上经历了飞速的技术迭代。脸、口型、声音乃至微表情越来越逼真,但真正交流几十秒之后,另一种 " 不像人 " 的割裂感往往很快出现:它不知道你还没说完,不知道什么时候应该看着你,更不知道你一个没有说出口的动作究竟意味着什么。

因为真正的人际交流从来不限于单纯的语言。

人在对话中会不断观察对方的状态,再决定自己应该倾听、等待、回应还是主动表达;自己的行为又会成为对方下一轮判断的输入。社交本身就是一个持续运行的反馈回路。

这也是   Genesis-1.0   想强调的" 类人交互 "体验。

视频来源:Frame-X

这些动作本身并不难生成,真正困难的是:用户并没有先告诉模型 " 接下来请挥手 " ——行为是由交互本身触发的。

一个更纯粹的测试场景:用户把手放到摄像头前做出数字手势,然后问角色 " 这个加起来等于多少 "。

这时候,问题已经不再是简单的动作跟随:模型不仅需要准确感知摄像头里发生了什么,还要结合交互历史,把视觉和语言信息联系起来,再决定下一刻应该给出什么反馈。

形界把这种能力称为" 端到端行为推理 "。这里的 " 推理 " 不必简单等同于大语言模型内部的思维链。更值得关注的是它对应的产品能力:实时视频模型开始从 " 被动按照指令生成动作 ",走向 " 根据当前场景主动选择行为 "。

这和今年   GPT-Live   给语音交互带来的体验颠覆非常相似。

GPT-Live   的自然感并不只来自声音本身,更来自一些行为细节:用户插话时,它能停下来;合适的时候会用很短的回应告诉用户 " 我还在听 "。正是这些看似细小的行为反馈,决定了一段交流是不是像真正的人类对话。

视频模态则把这种要求进一步放大了。

一个真实的人不仅会通过声音表现 " 我在听 ",还会用视线、表情、身体姿态和动作来表达自己的状态。也因此,视频双工面对的并不是一个简单的 " 语音助手加数字人外壳 " 问题,而要考虑如何把整套非语言互动也交给模型处理。

8   月,形界与中国科学技术大学等机构联合提出   SemComp-Bench。和传统视频   benchmark   关注画质、运动质量不同,它专门评价模型有没有真正完成用户要求的语义任务,并提出   Outcome Achievement   和   Generation Reliability   两类指标。

当视频只是一种内容时,最重要的问题是 " 生成得好不好看 ";但当视频变成实时互动方式以后,评价标准会多出更关键的一层:它有没有理解你,以及它有没有做出正确的行为。

所以   Genesis-1.0   想建立的 " 类人感 ",不只是一个看起来更逼真的   Avatar,更是一个能够完成倾听、思考、反馈、表达完整交互反应闭环的智能体。

1.5   秒背后,AI   的 " 反应 " 和 " 思考 " 开始被拆开

类人感还有一个很现实的前提:速度。

你向一个人挥手,对方   4   秒以后才慢慢挥回来,动作即使完全正确,交流仍然会显得怪异。真实社交里的自然感很大程度上来自   timing ——什么时候回应,什么时候等待,什么时候保持一个倾听中的表情。

形界此前发布沉浸式视频模型   Rise   时,公开展示过最低   500   毫秒级的端到端交互延迟。其背后的技术主张,是把视频输入、行为理解和画面生成拉进同一个连续时序中,尽量减少独立理解模型与生成模型之间的串行传递。

Genesis-1.0   延续了这条思路。但进入社交场景以后,它还需要处理另一个矛盾:有些反馈必须立刻发生,有些任务却需要更长的计算时间。Genesis-1.0   此次给出的画面行为平均响应时间是   1.5   秒。模型本身会持续感知用户输入,并即时生成角色的动作、表情和画面,维持低延迟感知和生成的闭环;Genesis-1.0-Brain   则负责问答内容、语言风格、MCP   工具调用等更高层的异步规划。

这里的核心并不是简单把所有任务都压缩到   1.5   秒以内,而是让 " 反应 " 和 " 思考 " 运行在两个不同的时间尺度上。当用户抬手打招呼时,角色不应该等一个复杂的大模型完成数秒推理以后才做出动作;但当用户要求它回答复杂问题、调用工具或者完成某项任务时,系统又必须允许更深的推理发生。

如果所有能力被串在一条链路里,任务越复杂,模型越聪明,交互就可能越慢。更合理的方式,是让即时感知和行为生成保持高速运转,同时把需要更多计算时间的智能任务放到另一层异步完成。

有意思的是,GPT-Live   在系统设计上采用了类似的分层思路。OpenAI   的全双工语音模型负责维持实时交流,需要复杂推理或工具使用时,再异步委托后台模型处理,而当前语音流不必因此中断。

但 " 视频版   GPT-Live" 这个说法并不是说   Genesis   与   GPT-Live   使用了相同的技术架构,而是两者都在处理实时   AI   的共同矛盾点:人要求即时反馈,但智能本身需要时间。实时交互时代的产品需要一种新的能力——即使   AI   还在 " 想 ",它也不能在关系层面消失。

对于声音,这意味着倾听、停顿和简短回应;对于视频,则意味着眼神、表情、身体动作,以及始终保持 " 在场 " 的状态。

这可能比单纯把延迟从   2   秒压到   1   秒更重要。

从文件到软件,视频会成为下一代人与   AI   的交互界面

传统视频模型的交付物通常是一段内容。生成结束,模型的工作也就结束了。但一个社交角色、陪伴对象或者互动世界不止于此。它必须长期存在,持续接受另一个人的输入,并在每一次新的交互之后动态更新自己的状态。

这也是   Genesis-1.0   更大的产品野心。过去,构建一个长期在线的虚拟角色,开发者需要分别处理角色资产、剧情逻辑和各种事件反馈。内容制作和交互逻辑是两个高度依赖人工的割裂系统。生成式   AI   首先改变了前者。形界接下来想做的,是让模型继续吞掉后者。

他们并不只想把一个   AI   角色直接交到用户手里,而是希望把 " 持续在场、敏锐感知和即时回应 " 这些能力进一步沉淀为一种可被不同互动产品复用的底层基础设施。社交陪伴是目前最直接的落点,但这套能力同样可以延伸到直播、游戏   NPC、互动娱乐以及其他今天尚未成熟的产品形态中。

当一个模型能够理解用户、持续维持人物和环境状态,并根据交互直接决定下一刻发生什么,开发者得到的就不只是 " 生成一段视频的   API",而开始接近一套新的互动内容生产方式——没有冗余系统," 模型即产品 "。

但对商业落地而言,这件事最终要落到非常现实的问题上:一个角色能在线多久?用户一个动作以后要等多久?互动能否超越一张会说话的脸?以及当几千、几万名用户每天持续使用时,这套体验在经济上能不能成立?只有这些指标同时过线,实时视频才可能从模型   Demo   变成社交、陪伴、直播和互动娱乐真正可调用的一层基础设施。

形界特别看重社交场景,也正是因为它对这套技术提出的要求最完整。直播允许内容仍然以 " 主播 " 为中心,游戏可以预先规定大量交互规则,而社交需要模型真正围绕另一个人不断调整自己的行为——它既考验内容生成,也考验感知、理解和即时反馈。

对于一家刚成立数月的公司,形界没有选择先用很长时间去讲一个宏大的世界模型故事,再慢慢等待技术成熟,而是几乎每一个阶段都拿出能够被实际感知到的成果。Genesis-1.0   就是在这条务实路径上一次明确向产品层的收束:同时解决时长、行为、响应和成本这四个指标。

但技术走到这里以后,问题已经开始不同。

过去,用户打开一个   AI   产品,通常是为了得到一段内容或者一个答案:人输入需求,机器返回结果,交互是离散的。这种受限的信息带宽无法支撑起更加复杂的应用。而社交和陪伴需求是另一种深度关系——一个对象长期存在,精准感知用户现在的状态,并根据双方共同经历的历史持续互动。

文字很难承载这种关系,语音把它向前推了一步,而视频提供了更高的信息带宽。所以   Genesis-1.0   真正押注的,并不只是   AI   视频的下一次升级。它押注的是一种新的交互范式:让视频从   AI   生成的一次性结果,变成人和   AI   之间持续发生的交互本身。

过去的视频模型,往往以 " 生成完成 " 为终点。如果这条路线成立,那么下一代互动模型真正重要的竞争力,可能恰恰是:它不再轻易结束。

" 无论你什么时候来,她都在。"点击链接进入   Genesis-1.0   直播间,和她打个招呼吧~

https://www.frame-x.ai/models/genesis

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

语音助手
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论