今年 7 月,OpenAI 发布 GPT-Live。相比过去一问一答式的语音助手,其核心突破不仅在于更自然的拟真音色,更在于把 AI 的交互方式从 " 回合制 " 推向了真正的实时对话:模型具备边说边听的全双工能力,支持随时打断,甚至懂得在恰当的时机保持沉默;遇到复杂推理和工具调用时,再把任务交给后台模型处理,而不需要让当前对话停下来。OpenAI 当时披露,每周已经有超过 1.5 亿人通过 Voice、Dictation 等语音功能和 ChatGPT 交互。
这件事带来的一个直观变化是,人开始更愿意和 AI 进行更长时间、更高频率的持续互动。
文字聊天天然是一种 " 输入—回答 " 的离散交互,语音则更接近现实中的持续交流。而当交互形式继续从 Voice 走向 Video,问题会再往前一步:AI 不仅要一直听着,还要一直 " 看着 "。
用户正在说话还是已经停下来,脸上的表情是什么,突然挥了挥手还是比了一个心,甚至一句话都没有说,只是移开视线——这些没有进入文字和语音的信息,本身就是人与人交流的一部分。
9 月 18 日,成立不到四个月的形界智能(Frame-X)计划正式发布 Genesis-1.0,并向用户开放体验 24 小时 AI 直播。形界把它定位为一套面向 AI 社交、陪伴和互动娱乐的视频双工模型。
相比今年 7 月在 WAIC 首次亮相的 Genesis,1.0 版本给出了一组更接近产品化的数字:连续生成超过 24 小时,画面行为响应平均 1.5 秒,最快可达到 1.2 秒,支持全身动作,调用价格为每秒 0.003 美元。
放到今天的实时 Avatar 市场里,这组参数已经颇具进攻性。Runway Characters 的 API 单次会话最长为 5 分钟;HeyGen LiveAvatar 根据不同产品层级,单次会话上限从 5 分钟到 60 分钟不等;另一家实时视频公司 Vivix 推出的 A1,则把能力进一步扩展到全身动作与开放世界交互,并持续响应新的用户输入。
图片来源:Frame-X
但 24 小时、1.5 秒这些数字并不是 Genesis-1.0 真正想讲的故事。
形界把一个面向社交的 AI 角色需要具备的基本能力归结成两件事:它能不能一直在,以及它是不是真的看得到你。前者要求模型长期维持一个稳定的角色和世界;后一个问题则更接近真实社交的本质—— AI 不仅要听懂用户说了什么,还要持续读取人的表情、动作、姿态乃至沉默,把这些非语言信号一并纳入交互。只有做到这一步,视频才不只是给用户看的输出,而真正成为模型类人感行为输出的另一条通道。
长时一致性大考:24 小时不宕机背后的 " 世界维持 " 能力
今天绝大多数 AI 视频仍然是一种有终点的内容。
用户输入一句提示词,模型生成几秒或者几十秒的视频,任务就结束了。但实时交互视频没有天然的终点,它更像一场不会提前写好剧本的直播,用户可能随时改变动作、说一句话、拿起一个物体,甚至突然离开镜头。视频必须根据已经发生的一切实时演算继续向前生成。
这也带来了实时视频最棘手的问题之一——误差累积。
实时视频生成采用 Auto-Regressive(AR)方式连续生成,模型刚刚生成的结果很快会成为下一轮生成的上下文。一次很小的偏差,如果没有被纠正,就可能不断传下去:先是人物五官稍微变化,接着衣服颜色漂移、物体消失、空间结构变形,最后连人物和环境之间原本成立的关系都逐渐失真。
所以,当生成时间从几十秒拉长到几十分钟甚至数小时,真正关键的问题在于画面的一致性——生成到足够久以后,模型还知不知道这个世界现在的确切状态。
Genesis-1.0 此次针对长时误差累积与生成一致性问题进行了专项优化,将业界约 5 分钟级的互动时长,提升至稳定的 24 小时。
但 24 小时本身并不是重点。它更像一次压力测试,测试模型在经过成千上万轮连续生成之后,角色身份、场景结构和已经发生过的状态变化能否继续被模型正确继承。
这和大语言模型的长上下文能力有些相似。长上下文的关键并不是简单 " 读得更长 ",而是在经历大量历史以后,仍然知道哪些信息和当前有关。放到视频里,就是运行足够久之后,模型仍要知道谁是谁、东西在哪里、此前发生过什么,以及下一刻有哪些状态要保持连续。
如何解决这一问题,行业正在出现不同的技术路线。
一种典型思路是 3D / Spatial 路线:在视频之外显式保存空间结构、物体状态和历史记忆。世界的结构由一套结构化状态负责维护,而视频模型更像一个翻译器,负责把它渲染成画面。对于游戏、仿真等要求精确空间关系的场景,这是一条非常自然的技术路线。
但形界押注的是另一种选择:让视频模型自己学习和维护世界状态。
它希望人物身份、空间关系和历史变化直接沉淀在模型学习到的视频表征中,而不是随着世界越来越复杂,在模型之外同步增加一套越来越庞大的状态系统。
这背后是一种更彻底的 Scaling 假设:如果世界的结构、状态和变化规律本身可以被视频模型学习,那么随着模型规模、数据规模和训练规模增加,模型能够在同一种表征中不断吸收更复杂的世界知识。相比之下,一旦把大量状态显式放在模型之外,世界复杂度上升时,外部结构化表示也需要同步变得更加复杂。
换句话说,形界希望把 " 记住世界 " 也逐渐变成模型能力本身,而不是长期依靠模型之外的一套工程系统兜底。
这当然还不是一场已经有定论的路线之争。显式 3D 状态在许多场景中有不可替代的确定性优势,而一次 24 小时实验也不足以证明视频表征能够解决所有长期记忆问题。
但 Genesis-1.0 至少把这个原本偏研究的问题向前推进了一步:互动视频开始从" 不断生成下一段内容 ",走向" 持续维护一个正在运行的状态 "。更值得注意的是它的迭代速度:从今年 7 月 Genesis 在 WAIC 首次公开亮相,到 Genesis-1.0 把连续生成推到 7x24 小时,中间只隔了两个月。
告别 " 套皮数字人 ",端到端行为推理创造真正的 " 类人感 "
不过,对于 Genesis-1.0 来说,长时稳定只是一层地基。如果一个角色能够在屏幕里稳定存在 24 小时,却对屏幕外用户的举动毫无察觉,它仍然只是一张无限延长的动态壁纸。
过去几年,数字人在 " 长得像人 " 这件事上经历了飞速的技术迭代。脸、口型、声音乃至微表情越来越逼真,但真正交流几十秒之后,另一种 " 不像人 " 的割裂感往往很快出现:它不知道你还没说完,不知道什么时候应该看着你,更不知道你一个没有说出口的动作究竟意味着什么。
因为真正的人际交流从来不限于单纯的语言。
人在对话中会不断观察对方的状态,再决定自己应该倾听、等待、回应还是主动表达;自己的行为又会成为对方下一轮判断的输入。社交本身就是一个持续运行的反馈回路。
这也是 Genesis-1.0 想强调的" 类人交互 "体验。
视频来源:Frame-X
这些动作本身并不难生成,真正困难的是:用户并没有先告诉模型 " 接下来请挥手 " ——行为是由交互本身触发的。
一个更纯粹的测试场景:用户把手放到摄像头前做出数字手势,然后问角色 " 这个加起来等于多少 "。
这时候,问题已经不再是简单的动作跟随:模型不仅需要准确感知摄像头里发生了什么,还要结合交互历史,把视觉和语言信息联系起来,再决定下一刻应该给出什么反馈。
形界把这种能力称为" 端到端行为推理 "。这里的 " 推理 " 不必简单等同于大语言模型内部的思维链。更值得关注的是它对应的产品能力:实时视频模型开始从 " 被动按照指令生成动作 ",走向 " 根据当前场景主动选择行为 "。
这和今年 GPT-Live 给语音交互带来的体验颠覆非常相似。
GPT-Live 的自然感并不只来自声音本身,更来自一些行为细节:用户插话时,它能停下来;合适的时候会用很短的回应告诉用户 " 我还在听 "。正是这些看似细小的行为反馈,决定了一段交流是不是像真正的人类对话。
视频模态则把这种要求进一步放大了。
一个真实的人不仅会通过声音表现 " 我在听 ",还会用视线、表情、身体姿态和动作来表达自己的状态。也因此,视频双工面对的并不是一个简单的 " 语音助手加数字人外壳 " 问题,而要考虑如何把整套非语言互动也交给模型处理。
8 月,形界与中国科学技术大学等机构联合提出 SemComp-Bench。和传统视频 benchmark 关注画质、运动质量不同,它专门评价模型有没有真正完成用户要求的语义任务,并提出 Outcome Achievement 和 Generation Reliability 两类指标。
当视频只是一种内容时,最重要的问题是 " 生成得好不好看 ";但当视频变成实时互动方式以后,评价标准会多出更关键的一层:它有没有理解你,以及它有没有做出正确的行为。
所以 Genesis-1.0 想建立的 " 类人感 ",不只是一个看起来更逼真的 Avatar,更是一个能够完成倾听、思考、反馈、表达完整交互反应闭环的智能体。
1.5 秒背后,AI 的 " 反应 " 和 " 思考 " 开始被拆开
类人感还有一个很现实的前提:速度。
你向一个人挥手,对方 4 秒以后才慢慢挥回来,动作即使完全正确,交流仍然会显得怪异。真实社交里的自然感很大程度上来自 timing ——什么时候回应,什么时候等待,什么时候保持一个倾听中的表情。
形界此前发布沉浸式视频模型 Rise 时,公开展示过最低 500 毫秒级的端到端交互延迟。其背后的技术主张,是把视频输入、行为理解和画面生成拉进同一个连续时序中,尽量减少独立理解模型与生成模型之间的串行传递。
Genesis-1.0 延续了这条思路。但进入社交场景以后,它还需要处理另一个矛盾:有些反馈必须立刻发生,有些任务却需要更长的计算时间。Genesis-1.0 此次给出的画面行为平均响应时间是 1.5 秒。模型本身会持续感知用户输入,并即时生成角色的动作、表情和画面,维持低延迟感知和生成的闭环;Genesis-1.0-Brain 则负责问答内容、语言风格、MCP 工具调用等更高层的异步规划。
这里的核心并不是简单把所有任务都压缩到 1.5 秒以内,而是让 " 反应 " 和 " 思考 " 运行在两个不同的时间尺度上。当用户抬手打招呼时,角色不应该等一个复杂的大模型完成数秒推理以后才做出动作;但当用户要求它回答复杂问题、调用工具或者完成某项任务时,系统又必须允许更深的推理发生。
如果所有能力被串在一条链路里,任务越复杂,模型越聪明,交互就可能越慢。更合理的方式,是让即时感知和行为生成保持高速运转,同时把需要更多计算时间的智能任务放到另一层异步完成。
有意思的是,GPT-Live 在系统设计上采用了类似的分层思路。OpenAI 的全双工语音模型负责维持实时交流,需要复杂推理或工具使用时,再异步委托后台模型处理,而当前语音流不必因此中断。
但 " 视频版 GPT-Live" 这个说法并不是说 Genesis 与 GPT-Live 使用了相同的技术架构,而是两者都在处理实时 AI 的共同矛盾点:人要求即时反馈,但智能本身需要时间。实时交互时代的产品需要一种新的能力——即使 AI 还在 " 想 ",它也不能在关系层面消失。
对于声音,这意味着倾听、停顿和简短回应;对于视频,则意味着眼神、表情、身体动作,以及始终保持 " 在场 " 的状态。
这可能比单纯把延迟从 2 秒压到 1 秒更重要。
从文件到软件,视频会成为下一代人与 AI 的交互界面
传统视频模型的交付物通常是一段内容。生成结束,模型的工作也就结束了。但一个社交角色、陪伴对象或者互动世界不止于此。它必须长期存在,持续接受另一个人的输入,并在每一次新的交互之后动态更新自己的状态。
这也是 Genesis-1.0 更大的产品野心。过去,构建一个长期在线的虚拟角色,开发者需要分别处理角色资产、剧情逻辑和各种事件反馈。内容制作和交互逻辑是两个高度依赖人工的割裂系统。生成式 AI 首先改变了前者。形界接下来想做的,是让模型继续吞掉后者。
他们并不只想把一个 AI 角色直接交到用户手里,而是希望把 " 持续在场、敏锐感知和即时回应 " 这些能力进一步沉淀为一种可被不同互动产品复用的底层基础设施。社交陪伴是目前最直接的落点,但这套能力同样可以延伸到直播、游戏 NPC、互动娱乐以及其他今天尚未成熟的产品形态中。
当一个模型能够理解用户、持续维持人物和环境状态,并根据交互直接决定下一刻发生什么,开发者得到的就不只是 " 生成一段视频的 API",而开始接近一套新的互动内容生产方式——没有冗余系统," 模型即产品 "。
但对商业落地而言,这件事最终要落到非常现实的问题上:一个角色能在线多久?用户一个动作以后要等多久?互动能否超越一张会说话的脸?以及当几千、几万名用户每天持续使用时,这套体验在经济上能不能成立?只有这些指标同时过线,实时视频才可能从模型 Demo 变成社交、陪伴、直播和互动娱乐真正可调用的一层基础设施。
形界特别看重社交场景,也正是因为它对这套技术提出的要求最完整。直播允许内容仍然以 " 主播 " 为中心,游戏可以预先规定大量交互规则,而社交需要模型真正围绕另一个人不断调整自己的行为——它既考验内容生成,也考验感知、理解和即时反馈。
对于一家刚成立数月的公司,形界没有选择先用很长时间去讲一个宏大的世界模型故事,再慢慢等待技术成熟,而是几乎每一个阶段都拿出能够被实际感知到的成果。Genesis-1.0 就是在这条务实路径上一次明确向产品层的收束:同时解决时长、行为、响应和成本这四个指标。
但技术走到这里以后,问题已经开始不同。
过去,用户打开一个 AI 产品,通常是为了得到一段内容或者一个答案:人输入需求,机器返回结果,交互是离散的。这种受限的信息带宽无法支撑起更加复杂的应用。而社交和陪伴需求是另一种深度关系——一个对象长期存在,精准感知用户现在的状态,并根据双方共同经历的历史持续互动。
文字很难承载这种关系,语音把它向前推了一步,而视频提供了更高的信息带宽。所以 Genesis-1.0 真正押注的,并不只是 AI 视频的下一次升级。它押注的是一种新的交互范式:让视频从 AI 生成的一次性结果,变成人和 AI 之间持续发生的交互本身。
过去的视频模型,往往以 " 生成完成 " 为终点。如果这条路线成立,那么下一代互动模型真正重要的竞争力,可能恰恰是:它不再轻易结束。
" 无论你什么时候来,她都在。"点击链接进入 Genesis-1.0 直播间,和她打个招呼吧~
https://www.frame-x.ai/models/genesis


登录后才可以发布评论哦
打开小程序可以发布评论哦