甲子光年 20小时前
AI创作的下半场:从模型之战到系统之战
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

AI 创作赛道,正在从模型层转移到系统层。

作者|寇雨然

编辑|栗子

过去两年,生成式 AI 最激烈的战火集中在模型层。

从 Midjourney 到 GPT Image,从 Sora 到 Seedance,大厂们在画质、物理规律和上下文窗口上疯狂内卷。

模型能力的提升,也让 AI 创作进入各行各业的具体工作。品牌市场团队用它制作广告和传播素材,电商运营持续生产商品视觉,游戏团队开发人物、场景和世界观,汽车与科技公司的业务团队也开始用 AI 制作产品演示、发布会视频和其他视觉资产。

应用范围扩大的同时,市场对这类应用的预期也在升温。

Grand View Research 预计,生成式 AI 内容创作市场将从 2024 年的 148 亿美元增长至 2030 年的 801 亿美元,年复合增长率超过 30%。而 Bloomberg Intelligence 也预测,到 2032 年生成式 AI 整体市场规模将达到 1.3 万亿美元。两个预测的统计口径不同,但都指向一个仍在快速增长的市场。

但当 AI 真正进入这些使用场景,一道落差逐渐显现:

AI 可以生成内容,却还难以支撑一次完整的创作。

今天,无论是营销提案、商业演示,还是影视创作,AI 仍然更多停留在单点工具阶段:生成一张图片、一个视频、一段文字,或者完成某一个具体任务。项目一旦涉及多个模型、不同版本和多人协作,使用者仍要在各种工具之间切换,反复搬运素材和补充上下文。

因此,下一阶段生成式 AI 竞争的重点,正在从单个模型的能力,转向如何把模型、工具、数据和项目上下文组织成一套完整的创作系统。

1.AI 创作领域需要自己的 Codex

一位长期使用 AI 辅助工作的创作者向「甲子光年」描述了自己的工作流:确定一个创意方向后,需要在 Claude、Gemini 等模型中讨论方案,在 Pinterest 寻找视觉参考,用 Midjourney、GPT Image 生成素材,再用各种网页端、设计软件、视频工具完成制作。

但问题在于,这些工具、AI 都有学习或者说组织提示词的成本;同时,工具之间又没有项目记忆。创作者或团队更多的时间并没有花在对创意的表达上,而是在各个工具之间切换、迁移,反复调整。

这套流程更像是一条 " 工具组装流水线 "。

这种困境,让人想起编程领域曾经的演变。

23 年,大模型刚刚进入 Coding,Github Copilot 让开发者们从复制粘贴,修修补补变成一路 tab、tab、tab,彼时的竞争焦点还是模型本身。

一年后,随着模型上下文窗口的扩充,AI 已经具备理解整个项目的能力,Cursor 出现了。

到了 25 年,以 DeepSeek 为代表的模型公司对思维链的打磨,已经让 AI 不仅能理解代码意图,还能做规划、自检等更多复杂任务。跟着,Codex、Claude Code 的 Agent 相继推出,整个赛道从 " 哪个模型更强 " 的比拼,转向了 " 谁的 AI Native 工作系统更能真正进入专业工作 "。

Coding 领域人机协作的演变模式,对 AI 创作赛道来讲,无疑是一个成功范本。

今天的 Codex,也不仅仅只是 Coding 某个单一环节的提效工具,而是从需求文档,到项目规划、方案制定、代码编写、测试验证、部署上线的完整闭环。模型只是基础,外围还需要记忆系统,工具调用能力、运行环境等等。现在,开发者已经不再需要在终端、浏览器、文档、IDE 之间反复横跳,而是一切在对话中完成。

Vibe Coding 不止是降低了外行的编程门槛,也让无数工程师受益。

但在 AI 创作领域,还缺一个属于自己的 Codex。真正帮助专业创作者完成复杂制作,让市场、运营、产品等岗位不必先学会并拼装一整套工具,就能把想法做成视觉资产的 Vibe Creating 尚未发生。

而 TapNow 要做的,正是这件事。

2. 从灵感到成片,重构创作全流程

2025 年 5 月,TapNow 率先推出的 AI 节点画布,面向需要生产视觉内容的个人与团队,将 AI 创作从线性的聊天交互,带入可视化、可编辑、可协作的工作流。

现在,这种节点式工作流已成为 AI 创作产品的主流交互范式。

但 TapNow 想定义的,从来不是一个画布,而是一套属于 AI 时代的创作方式。从广告、电商、动画和 MV 制作,到游戏美术、汽车营销和消费品牌的视觉资产生产,不同行业都在尝试用 AI 串联创意、素材与交付流程。

在 TapNow 官网可以看到海量案例,其客户覆盖互联网、游戏、汽车、消费和影视等行业,包括腾讯、阿里巴巴、网易、字节跳动、理想汽车、比亚迪、叠纸和壹同传奇等头部企业与创作团队。

这些场景面对的任务各不相同,却都会碰到相似的问题:一个项目往往要同时处理脚本、人物、场景、镜头、素材版本和团队反馈。节点画布解决了内容生成与编排的问题,完整的创作链路还需要更多工具共同参与。

围绕这些环节,TapNow 一直在沉淀基础设施:可以预演场景美术、人物走位和镜头设置的 3D 片场,支持预览剪辑的剪辑台 Playlsit,以及多端在线协作的团队协作画布等等。每一个模块,都对应着创作链路中的一个真实环节。

当这些能力逐渐成熟,从剧本阶段到剪辑包装,TapNow 终于把整条创作链路融合成了一个完整的系统。

于是今年,TapNow 从 Workflow 走向了 Creative OS ——一款原生面向 AI 创意生产的系统。

   从创意开始:Brainstorm 模式

只要输入一个故事灵感,或一段简短的业务 Brief,TapNow 的「头脑风暴」模式就会通过连续提问帮助使用者展开方案。短片项目可以逐渐勾勒人物、世界观和剧情,广告项目则可以梳理产品卖点、受众和视觉方向。对话还会自动沉淀为剧本节点,并生成 Pitch Deck,用于团队或客户沟通。

这里小编尝试了两个场景的创作,一个是治愈小短片,一个是广告制作。

对这两个场景小编其实都只有一个模糊的想法,但跟着 Brainstorm 模式往下走,最终都顺利完成了脚本。

治愈小短片的提示词是:帮我创作一个宫崎骏风的未来都市治愈小故事。

中间只需要不断的在给出的建议方案中选择,最终就完成了剧本、世界观、角色设设定、分镜的创作。

人物设定图还是很符合宫崎骏风的。

设计的分镜生成的小短片风格和一致性也都不错。

创意广告小编给的提示词是:帮我创作一个泰式的推销 3D 打印鞋的广告。

跟着头脑风暴的提示,最终也生成了完整的创意报告,广告项目由一句模糊需求推进到了可以继续制作分镜和视频素材的方案阶段。

   走进真实工作现场:原生 APP 与工具集成

创意有了,下一步是落地。但需求文档、会议记录、素材管理、团队协作往往分散在不同平台。

TapNow 的 Creative OS 打通了飞书、Slack、Notion、Google Drive 等主流工作工具,还有 Unsplash、Frame.io 等创意领域产品。Agent 可以基于已有的项目资料、会议记录和团队文档开展工作,而不是从一个空白 Prompt 开始。创作成果也可以回流到工作平台,形成闭环。

对市场、运营和产品团队来说,这意味着需求文档、会议结论和既有素材可以直接进入项目上下文,无需先整理成一条完整的 Prompt。

TapNow 集成的插件(部分展示),图片来源:TapNow

这里小编只给了非常简单的提示词 " 将当前画布的人物设计和剧本输出到飞书文件中 ",TapNow 就把世界观、风格、人物设计、剧本都输出到新建的飞书文档里面了。

   持续进化:Skill-Creator 沉淀创作方法论

Brainstorm 解决了 " 创意从哪来 ",工具集成解决了 " 工作在哪做 "。但还有个问题,每次工作积累的方法和经验,如何沉淀下来?

TapNow 集成了多个 Skill,其中就包括 Skill-Creator,利用这个 Skill,我们每个人都能创建自己的可复用技能。下次做类似项目时,就不用重新搭建工作流,一键启动。用得越久,系统就会越理解个人或团队的审美偏好、品牌规范和工作习惯。

用法也很简单,只需要 "/" 选择技能,然后再输入提示词 " 总结一套我的创作方法论,汇总成 skill" 就可以。

3. 创作系统,不止是 Agent

过去一年,Agent 成为了生成式 AI 应用竞争的新焦点。

从代码开发到内容生产,越来越多 AI 产品开始尝试替用户完成复杂任务。

那么,为什么 TapNow 选择做 Creative OS,而不是做一个更好的 Agent?

因为 Agent 只是一个优秀的执行者,但 Creative OS 是整套可迭代的执行系统。 单一 Agent 解决的是 " 怎么做 " 的问题。而 Creative OS 要解决的是如何让所有 Agent、模型、工具、数据、上下文在同一个系统里有序协作、持续演化。

这也是为什么 AI 领域开始关注 Harness Layer。

今年 7 月,黄仁勋在 LangChain 创始人 Harrison Chase 的访谈中反复提及 Harness,他直言,模型已经足够好了,下一代软件公司需要的是一套 Harness 系统,让我们能够在上面自行构建和应用。

如果只做 Agent,功能再多也会被下一版模型更新抹平。但一套为模型打造的操作系统,整合了工具、工作流和项目上下文。模型可以换、可以升级,模型之下的系统才是下一代软件生态的关键卡位。

但其实现在很多人不理解,AI 圈反复提及的 Agent、Harness 似乎只是一个抽象的概念,对从业者究竟有什么用?

首先,无论是短片、广告还是产品演示,视觉资产生产都需要持续修改和协作,很少是一次生成就结束。

一个 Agent 可以生成一段视频,但它不记得团队为什么选择某种视觉方向。当产品卖点、剧本或客户意见发生变化时,它也不会自动调整后续素材,或者调取前期参考。

而一套具备了 Harness 的 Agent 操作系统,却能串联这些生产链条—— Brainstorm 沉淀的创意、工具集成导入的素材、Skill-Creator 封装的工作流。每个环节都是相连的,不需要反复告诉 Agent 项目上下文,当前进行到什么节点,也不需要手动导入导出剧本。

这看起来似乎只是时间上的节约、工作流的简化,但更大的意义在于,当创作者、项目团队不再需要把大量精力花在素材搬运、版本确认和上下文补充上,那么这些时间就会自然回流到创意本身。

过去两年,每个新模型出来,创作者都要重新学一套 Prompt 语法;模型升级,之前积累的工作流可能失效。但 TapNow 的 Harness Layer 承担了这部分适配工作。

Harness Layer 内置的特定的 Prompt,能让 Agent 自动完成剧本生成、素材组织、人物设计、场景分镜等等。并且,这些 Prompt 并不是模型发布后才开始适配的。TapNow 会在各家大模型发布前,就和模型厂商内部合作,预先设计出独特的 Prompt 语法,微调 Agent 偏好,让最强模型在 TapNow 上释放出最大潜力。

一个典型的例子是 TapNow 的 3D 片场。这个模块可以直出白模素材,能够适配 Seedance2.5 的超强白模渲染能力,这就是前置协同设计的结果。当模型还在内部测试阶段,TapNow 就已经知道它擅长什么、需要什么样的输入,并据此调整了自己的工作流。

当模型能力进一步提升时,项目团队无需重新搭建流程,只需要在同一套系统中调用更强的模型。

所以,Creative OS 的价值并不只是提高某一个环节的效率,也体现在它为使用者和模型建立了一层可以长期复用的基础设施。

从 3D 场景搭建、视频剪辑、声音设计,到团队协作和外部应用生态连接,将过去分散的创作环节整合到同一个系统中。通过连接 Notion、Frame.io 等创意工具和工作平台,Creative OS 不再只是一个生成工具,而成为连接创意、生产和协作的 AI 原生创作环境。

未来,创作不应该是在几十个网页和工具之间反复切换,而应该让每个人都能够借助 AI,自由、完整的实现创意。

(封面图来源:TapNow)

END.

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 物理 规律
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论