IPO早知道 19小时前
智象未来vivago R1全球上线:对话即创作,AI视频agent 迈向完整交付
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

vivago R1 直接实现一句成片时代的 " 完全交付作品 "。

本文为 IPO 早知道原创

作者|SY

微信公众号|ipozaozhidao

据 IPO 早知道消息,9 月 8 日,智象未来(HiDream.ai)旗下内容创作智能体 vivago R1 全球上线,国内版本 「够搭」 全新升级发布。

vivago R1 最早于今年 7 月份举办的 WAIC 2026 上亮相。vivago R1 的核心突破,在于实现了从一句成片时代的 " 生成片段 " 到 " 完全交付作品 " 的范式跃迁。据了解,它依托智象 " 基础模型 + 智能体 " 双轮驱动技术战略,让创作者以自然语言对话的方式,即可完成从创意表达到高质量成片交付的完整创作流程。

图片来源:智象未来(下同)

R1 可一次性生成 5 分钟视频,并支持通过多轮操作延长视频。R1 通过 Agent 系统对长任务进行规划与调度,主 Agent 拆解创意,子 Agent 协同完成脚本、分镜、角色、场景与音效,确保角色形象、场景风格和叙事节奏在多段落中保持一致。

同时,依托智象未来自研 HD-AgentOS 的全流程调度与治理能力,R1 内容有效可用成功率提升至 85%,显著降低 " 抽卡 " 概率,让视频创作更具确定性。R1 还优化了跨镜头角色一致性和场景过渡自然度,弱化 AI 视频常见的 " 塑料感 " 和 " 瞬移感 ",实现更自然的运镜衔接与音画对齐,让长视频更接近实拍质感。

区别于行业中用节点、画布作为工作流的技术路线,R1 选择 Chat-First(对话优先)这一人类最自然的表达方式。用户只需用自然语言描述需求,R1 即可自动生成视频,并支持在对话中持续调整和迭代。

这种体验背后,是 " 做后 " 与 " 做厚 " 两条原则。" 做后 ",是把专业创作者的判断、审美和经验编码进 Agent 编排能力,形成强大的中后台;" 做厚 ",是构建 SkillHub,将抽象 AI 能力转译为产品广告、角色视频、故事短片、品牌内容等真实创作场景,让用户更容易理解能做什么、如何开始。

在完整流程中,用户只需表达目标,Agent 负责拆解和执行,SkillHub 则作为翻译层,自动匹配并编排所需 Skill 组合,将用户意图转化为可执行任务序列。R1 的对话式创作,让创作从 " 灵感闪现 " 到 " 进入执行 ",缩短到只剩一句话。

针对视频生成的一致性这一难点,智象未来通过基础模型与智能体系统双轮驱动,共同支撑复杂视频创作。一方面,智象自研的原生全模态世界模型技术理念,为 R1 提供多模态理解与生成基础能力。另一方面,智能体系统负责将模型能力组织为可持续推进的创作流程,确保复杂叙事中的角色形象、声音特征和风格前后一致。

具体而言,对于难以用语言准确描述的需求,用户也可以提供参考素材,由 R1 结合对话上下文理解需求并持续迭代。同时,R1 推出资产库功能,沉淀用户生成、筛选并认可的内容,并可在后续创作中复用。

最终,智象提炼出一套面向视频 Agent 的评估框架—— CHATS,用于衡量一个视频 Agent 是否具备真正的作品交付能力:

C(Consistency)一致性:角色、场景、风格在多镜头中保持稳定;

H(Human Intent)意图理解:准确理解用户创意,并能在多轮对话中持续推进;

A(Audio & Visual)视听完整度:不仅生成画面,也能组织声音、节奏与整体视听体验;

T(Timeline & Tale)时间线与叙事:让故事在多个镜头、多个段落中持续成立;

S(Stability)稳定交付:降低反复生成和返工成本,提高内容可用率。

据介绍,R1 在这五个维度上的表现,已在真实创作内测场景中得到验证。智象希望通过构建一个用户视角的标准,推动 AI Agent 产品的更好发展。

资料显示,vivago R1 的前身为 vivago.ai,该产品于 2024 年 5 月正式上线,成为全球最早一批公开可用的 AI 视频生成产品;今年 5 月,vivago.ai 登顶 Product Hunt 日榜第一。如今,vivago.ai 全球用户已突破 7000 万。

发布会后,IPO 早知道等机构与 vivago 产品负责人弓子建进行访谈,内容涉及产品能力、技术路径、用户需求和商业布局等方面。以下为访谈内容精编:

文生视频已进入追求故事性、合理性、深度性的阶段

Q:新的版本非常强调 " 无限时长 ",核心突破是什么?

弓子建:" 无限时长 " 的本质,并不是大家想象的生成一个小时或者更长的视频,而是在更长的时长内保持叙事合理、人物和场景一致、剧情连贯。

它由三件事支撑,我们叫「长长稳」:第一个长是无限时长,第二个是长思考,第三个是稳定生成。长思考负责在开头建立完整的世界观和故事框架;「记得住」则是 context engineering ——上下文里该记住的都要沉淀下来。缺少任何一个环节,单纯延长视频都没有意义。比如,一个十分钟的视频里有两分钟逻辑错误,整个视频就可能无法使用。

Q:为什么现阶段更强调叙事和逻辑,而不是画面效果?

弓子建:画面好看已经逐渐成为文生视频的基础要求。早期大家关心手指有没有出错、AI 味是不是太浓,现在更关心故事是否讲清楚、剧情是否合理、表达是否有深度。

短内容可以依靠视觉冲击力和爆点,但长内容需要依靠故事吸引用户持续观看。影视、广告、电商等场景,也不仅需要漂亮画面,更需要内容连贯、逻辑成立。这是视频 Agent 现阶段要解决的核心问题。

Q:这款产品到底是通用工具,还是垂直工具?核心场景是什么?

弓子建:我们的能力可以覆盖多种内容,但核心始终是叙事性和连续性。只要用户要做的内容需要较强的叙事和连续表达,就是我们重点服务的场景。

这不一定按 " 带货视频 "、" 广告视频 " 等类别划分。同样卖一瓶水,可以用炫酷镜头展示,也可以通过一个故事表达产品。后者更需要从想法、故事完善到生成的完整过程,也更符合我们的方向。

目前,我们重点面向社交媒体和视频平台上的内容传播,电视、大屏等场景暂时不是主要方向。

模型与 Agent 协同,追求生成效果天花板后让更多用户使用

Q:视频 Agent 相比传统对话式产品,最大的区别是什么?

弓子建:它需要更深入地思考、记住任务相关的信息,并在此基础上稳定完成生成。单轮对话也可能把一个问题想清楚,但长任务需要持续执行。Agent 不仅要在开始时建立完整框架,还要在后续生成中保持对人物、场景和事件状态的记忆,避免前后矛盾。因此,这是一组相互配合的能力,不能只看生成时长或某一个单独指标。

Q:智象未来做基础模型的经验,如何帮助视频 Agent 保持一致性?从 world model 的角度,最难的是什么?

弓子建:一致性落到工程上就是 context engineering 的 know how:上下文压缩一定会丢信息,关键是站在多模态的视角知道哪些不能丢、哪些可以丢。

vivago R1 的 Agent 是从基础模型里生长出来的——智象技术团队做过图像模型、视频模型、交互式世界模型,也都取得过很好的成绩,这些积累让我们知道 AI 如何构建世界、Agent 的方向在哪。

做模型的人清楚模型的上限在哪里,也知道怎么通过 Agent 的设计把上限拉高、把短板补齐。这就像读过很多书的人,写作时不会照搬任何一本书的写法,但功力都在。

Q:视频效果、生成效率和 Token 成本之间,如何平衡?

弓子建:现阶段我们优先保证效果,再通过架构和工程优化让更多用户用得起。我们的思路类似训练模型,先把能力做到当前能达到的最高水平,看到上限,再考虑加速和成本优化。如果一开始就围绕性价比做取舍,可能无法充分探索能力上限。后续我们可能推出 light 版本。

Q:更有性价比的版本,会有什么样的取舍?

弓子建:我们的目标是不牺牲目标场景中的效果,而是缩小能力覆盖范围。原来需要一个 " 六边形战士 ",以后可能由多个更专门的能力分别服务不同任务。

我们会针对用户实际用不到的场景覆盖进行取舍。复杂度降下来,成本自然就降下来。哪些场景保留、哪些舍弃,靠 CHATS benchmark 的数据说话,不靠主观判断——做 Agent 是评估优先,先构建 benchmark,再围绕它做决策。

以创作者需求为核心,通过体验与资产积累建立用户黏性

Q:目前的主要用户是谁?理想客户有什么特征?

弓子建:目前主要是社交媒体创作者,其中 YouTube 用户较多,其次是 TikTok 等平台的创作者,此外还有 OPC。

我们更希望服务有付费能力、重视创意价值、愿意用 AI 完成目标的用户。他们不会只停留在 " 生成一个结果 ",而是会不断交流、调整,直到把作品做好。

有些自由职业者尤其愿意投入时间和资金研究创作。我们未来可能会在这类用户身上投入更多精力。

Q:如何让普通用户也能做出专业创作者那样的视频?

弓子建:首先要降低门槛,让用户从一句话、一个想法开始。整个 Agent 的设计,也需要把原来依赖专业经验的部分能力提供给普通用户。

我们的目标是让普通人具备更强的表达能力。他可以把这种能力用于自己的社交媒体内容,不必因此成为职业导演。专业创作者也能受益,比如同时启动多个项目、探索多个想法,而不再被单一制作流程占满时间。

Q:当用户会随着新模型不断迁移,产品如何建立黏性?

弓子建:我们希望用户来这里的原因是 " 用 AI 完成一件事情 "。如果用户只关心使用哪个模型、哪个平台更便宜,他很容易迁移;如果他关注的是持续完成自己的创作,选择产品的标准就不同。

黏性一方面来自体验,从一句话、一个想法开始,产品能够理解他,并帮助他完成结果。另一方面来自上下文、记忆和数字资产的积累。比如,昨天已经建立了人物信息,今天就可以接着创作,不需要重新上传素材、重新解释人物关系。

Q:面对大厂的同类产品,创业公司的竞争优势是什么?

弓子建:大厂的优势明显:在成熟市场里挤压成本。但 AI 视频现在还没有稳定的场景可以挤压,大家都在开辟新场景——这恰恰适合创业公司。

新瓶一定要装新酒。市面上很多产品,要么是旧需求套上 AI,要么是新需求套传统产品形态;我们要做的是新需求加新产品形态。如果只求四平八稳,我们肯定干不过大厂;要做出让用户觉得爽的产品,才有机会。Chat-First(对话优先) 就是这个取舍的结果——它不是共识,是选择。

围绕创意价值探索商业模式,从海外走向全球市场

Q:这次推出了中文名够搭,是否意味着业务重心转向中国市场?

弓子建:我们的方向是从海外走向全球,其中也包括国内市场。

国内创作者生态已经发展得很好,尤其是超级创作者和 OPC,对工具价值有清晰判断,也愿意为能够支持创作的能力付费。同时,很多国内好的内容,优秀的创作者在海外社媒平台上也很受欢迎。

我认为,海外与国内用户的购买决策区别,也不能简单归结为付费意愿高低。同样一笔美元定价,在不同市场对应的消费感受不同,要放在当地的消费和价值认知中理解。

国内创作者的内容质量和商业化能力都在快速提升,我们国内版本「够搭」和全球版本 vivago R1 今天同步上线,就是要更好地服务包括国内创作者在内的全球用户。

Q:商业模式未来会怎样变化?为什么不主打低价竞争?

弓子建:商业模式跟着用户的消费能力和成熟度走——两年前用户把 AI 订阅当玩具,今天越来越多创作者把它当生产资料,预期它能帮自己把钱赚回来,这是消费心态的根本变化。

我们更关注创意和创意带来的价值。如果产品只按生成成本来衡量,就很容易进入价格竞争,而市场上总会有更便宜的方案。我们希望帮助用户把想法做成更有价值的作品,这种价值很难只用单条视频的制作成本衡量。

Q:AI 视频普及后,你们还会向社交媒体之外进行拓展吗?

弓子建:我个人认为,更值得关注的是内容分发方式的变化。

当 AI 让高质量、有叙事性的内容变得容易生产,内容供给会快速增加,现有的推荐逻辑可能不足以分发这些内容。未来可能出现更多去中心化的分发方式,但仅仅依靠好友关系,也不足以解决问题。

我们重视叙事性和连续性,也因为它们能够构建内容之间的关系。我过去在内容生产和消费两端都做过,因此我们做生产工具,最终还是要服务内容消费。

本文由公众号 IPO 早知道(ID:ipozaozhidao)原创撰写,如需转载请联系 C 叔↓↓↓

小马智行地平线文远知行

蜜雪冰城古茗沪上阿姨

极智嘉云迹科技特斯联

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ipo 微信公众号
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论