新浪财经 21小时前
对话智象未来弓子健:让普通人具备专业级表达能力,而非抢专业创作者饭碗
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

近日,智象未来旗下内容创作智能体 vivago R1 全球上线,国内版本 " 够搭 " 全新升级发布。

这不仅是版本迭代,更是一次行业信号的释放。可以说,vivago R1 的上线标志着 AI 视频创作迈入 " 单反级交付时代 "。过去需要一整个专业团队才能完成的高品质大片,如今或许每一位普通创作者就有机会独立完成。

如果说 Sora 用 15 秒视频惊艳了世界,为 AI 视频生成打开了一扇门,那么时至今日,行业仍徘徊在 15 至 30 秒的片段式生成阶段。而 R1 的突破正在于此:它能够一次性稳定输出 5 分钟高质量视频,并支持无限次多轮延长。从此,AI 视频不再只是 " 惊艳一刻 ",而开始拥有完整的叙事长度与表达纵深。

事实上,长视频生成的瓶颈从来不是单纯的时长数字,而是叙事的可持续性,即如何让故事在多镜头、多角色、多场景之间持续成立。R1 的解法是一套 Agent 调度系统:主 Agent 拆解创意,子 Agent 协同完成脚本、分镜、角色、场景与音效,确保角色形象、场景风格与叙事节奏在多段落中始终统一。而支撑这套系统运转的,是智象自研的 HD-AgentOS 全流程调度与治理能力。在其加持下,R1 内容有效可用成功率提升至 85%,视频创作从 " 碰运气 " 走向 " 可预期 "。

时至今日,AI 视频竞赛早已走出比拼几秒炫酷片段的早期阶段。算力与模型能力不断迭代,拉长视频时长只是表层结果,能否守住叙事逻辑、守住角色与场景的连贯,才是通往工业化内容生产的关键。R1 与 " 够搭 " 的落地,不只是把长时长工具交到创作者手中,也在重新定义 AI 视频的评判标尺,相比炫技式的视觉奇观,可信赖、可延续的完整叙事,才是 AI 影像真正走向实用化、落地化的必经之路。

就在 R1 上线一周之后的 9 月 15 日,智象再度正式发布原生全模态音视频生成模型 HiDream-O1-Video-1.0。

AI 长视频真正分水岭:故事合理、叙事真实

在智象未来的产品理念中,优秀的 AI 创作工具应当顺应人的表达本能。落到视频创作场景,创作的起点不该是节点、画布、参数这类技术要素,而是创作者本身想要传递、表达的内容。

基于这一思路,R1 采用 Chat-First(对话优先)的产品路线。对话是人类最自然的表达形式,同时也是对 AI 十分友好的交互入口。用户仅需输入自然语言描述创作诉求,R1 就能够自动产出视频,还可以依托对话交互,持续对作品进行调整、迭代。

这种体验背后,vivago 遵循 " 做后 " 与 " 做厚 " 两条原则。" 做后 ",是把专业创作者的判断、审美和经验编码进 Agent 编排能力,形成强大的中后台;" 做厚 ",是构建 SkillHub,将抽象 AI 能力转译为产品广告、角色视频、故事短片、品牌内容等真实创作场景,让用户更容易理解能做什么、如何开始。

长视频生成领域,绕不开一大核心痛点:内容一致性。如何让同一个人物、同一种声线,在数十组镜头、多轮生成过程中维持形象、风格统一?智象未来选择以 " 基础模型 + 智能体系统 " 双轮驱动作为解决方案。

一方面,自研原生全模态世界模型为 R1 提供多模态理解与生成底座。它能将文本、图片、视频、参考资产、文档说明与历史创作结果纳入同一任务语境,让 Agent 理解 " 任务全貌 ",而非执行单点指令。另一方面,智能体系统将模型能力组织为可持续推进的创作流程,在脚本、分镜、角色、场景、镜头与音效之间统筹调度,确保复杂叙事中角色形象、声音特征与风格前后统一。

在此基础上,R1 推出资产库功能,沉淀用户生成、筛选并认可的内容,供后续创作复用。一次创作不再是一次性输出,而成为下一次创作的素材基础。

谈及 " 无限时长 " 要攻克的最大难题,vivago 产品负责人弓子健给出了一个清晰的判断:" 无限时长 " 的本质,不是 " 能生成一小时就很牛 ",而是在更长的叙事跨度里,始终保持叙事合理、人物一致、剧情连贯。

他将这背后的支撑体系概括为 " 长长稳 ",三件事缺一不可:第一是 " 长 ",即无限时长本身;第二是 " 长思考 ",负责在开头建立完整的世界观和故事框架;第三是 " 稳 ",即稳定生成,确保叙事不崩。

而保证 " 稳 " 的核心,是系统能够 " 记得住 "。" 这本质上是 context engineering,上下文里该记住的都要沉淀下来,不能前一段记得角色穿红衣服,后面就丢失设定,开始自由发挥。" 弓子健解释。在他看来,最终的评估标准只有一个,就是逻辑合理。" 画面好看已经是基本功,任何产品都可以画面好看。故事合理、叙事真实,才是不同产品拉开差距的真正分水岭。"

至于 vivago 怎么保持角色、场景和事件状态的长期一致?弓子健表示,"vivago R1 的 Agent 是从基础模型里长出来的,源于团队做过图像模型、视频模型、交互式世界模型,这些积累让我们知道 AI 如何构建世界、Agent 的方向在哪。做模型的人清楚模型的上限在哪里,也知道怎么通过 Agent 的设计把上限拉高、把短板补齐。这就像读过很多书的人,写作时不会照搬任何一本书的写法,但功力都在。"

这份 " 功力 " 在本周有了新的注脚。9 月 15 日发布的 HD-V1,被定位为 " 首款物理规律导向视频模型 " ——长视频的地基,是单镜头的质量上限。该模型原生支持 5-20 秒任意时长单镜头生成,输出 1080p 高清画面,并会根据输入内容自主确定合适时长:让 " 讲多久 " 服务于 " 讲什么 ",而非反过来迁就模型的固定模板。R1 一次输出 5 分钟的成片,正是由这类高质量单镜头经 Agent 规划调度组合而成——先有 " 一段一段都成立 ",才有 " 一整部都成立 "

同时,"HiDream-O1-video 从架构之初便面向文本、视频与音频的统一表征。" 智象未来 CTO 姚霆表示," 它不只是‘把画面做出来’,更是把用户意图翻译成可执行的专业分镜,并同步生成可信的声音。这是原生全模态技术从‘看得清、动得顺’,迈向‘听得懂、说得准、演得连贯’的关键一步。"

直面本土创作者真实诉求

近期,AI 版《西游记》在社交媒体刷屏出圈,引发广泛讨论。有创作者借助 R1 对这部国民经典进行二次演绎,生成了近五分钟的西游主题视频作品。无论是人物角色的造型塑造、故事场景的氛围感渲染,还是独树一帜的东方奇幻气韵,都直观展现出 R1 对经典文本强大的视觉转译与落地能力。

优质的落地能力,让 vivago 在全球范围内快速成长。据悉,2024 年 5 月,vivago.ai 上线,成为全球最早一批公开可用的 AI 视频生成产品;今年 5 月,vivago.ai 登顶 Product Hunt 日榜第一;今天,vivago.ai 全球用户突破 7000 万。两年时间,智象从 " 第一个可用 " 走到第一个 " 单反级交付 "。

伴随 HiDream-O1-Video-1.0 视频模型的发布,智象同步完成 C+ 轮融资,投资方包括新微资本、交子资本、工银资本——国资及产业资本正加速向原生全模态世界模型赛道聚拢。

谈及商业模式,弓子健谈到," 我们商业模式跟着用户的消费能力和成熟度走,两年前用户把 AI 订阅当玩具,今天越来越多创作者把它当生产资料,预期它能帮自己把钱赚回来,消费心态发生了根本变化。" 并坦言," 我们不会做性价比生意,一条两百块成本能卖一万块的片子是创意生意,一条一千块只能卖两百块的是体力生意,我们做前者,因为创意无法被完全量化,一旦可量化,就进入了价格战。我们希望让更多普通人具备专业级的表达能力,而不是让所有人去抢专业创作者的饭碗,而是让这种能力被用在社媒表达上。"

过去,vivago 的业务重心长期放在海外市场,收获了全球大量创作者的验证。此番国内版本 " 够搭 " 全新升级正式发布,也意味着这套经过海外市场打磨的长视频创作智能体能力,正式落地国内,直面本土创作者的真实需求。

弓子健表示,"vivago 从海外出发面向全球,现在国内已拥有成熟的创作者生态,国内专业创作者对工具的付费决策逻辑已和海外用户相近,大量创作者也会把内容输出到海外平台。伴随国内创作者内容质量、商业化能力持续提升,够搭选择和海外版同步发布,以此服务包括中国创作者在内的全球用户。"

至于国内大厂也在做同类产品,智象未来的优势在于哪里?弓子健表示," 大厂的优势非常明显,在成熟市场里挤压成本。但 AI 视频现在还没有稳定的场景可以挤压,大家都在开辟新场景,这恰恰适合创业公司。"

他坦言,自己常和团队讲一句话:" 新瓶一定要装新酒。" 在他看来,市面上很多产品,要么是旧需求套上 AI,要么是新需求套传统产品形态。" 我们要做的是新需求加新产品形态,如果只求四平八稳,我们肯定干不过大厂,要做出让用户觉得爽的产品,才有机会。"

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 单反 竞赛 工业化
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论