重绘一张涂鸦后,AI 都学会了什么?
涂鸦变成鲜花,鲜花再长成一片花田——每一步的输出都是下一步的输入,中间任何一环偏了,误差就会沿着流程一路传下去。而当视觉 AI 完成了全部规划和试错,正确的经验能留下来吗?
由北航、港中文与新国大团队共同完成的OmniHarness给出了一种办法:参数不变,把做对的流程收进方法库,让下一次创作有经验可用。
画得出脑洞,改得准细节
从一张花朵涂鸦开始。

先重绘成写实红花,再沿用其风格生成花田。

前一步的结果,成为下一步的参考。
四格漫画要串起 " 醒来—看手机—发现周日—继续躺平 " 的剧情,兼顾动作、文字和画面衔接。

海报与书封,还要满足指定内容、标题和布局要求。

局部编辑更考验分寸:移除叉子或换成勺子,还要保留食物、杯子和桌面布局。
" 其他地方,尽量别动。"

一次成功,怎样变成一类任务的方法?
画对一次之后,换张图片、换个主题,经验还能派上用场吗?视觉智能体要走向实际创作,就绕不开这个问题。
OmniHarness 通过符号策略学习,把验证有效的做法提炼成一类任务可复用的方法。
红花和输入草图,是这道题的细节;" 先重绘、再用结果引导生成 ",则是一种可迁移的做法。换个主题,这条流程仍可作为适配新需求的起点。
策略是一套带使用说明的工作流:保留共享步骤、适用条件和依赖资源,去掉当前任务的具体输入。
新任务到来后,系统检查条件、填入新输入,再调整或组合已有策略。
自己出题、边做边检查、把经验留下来

第一步:挑选 " 踮踮脚够得着 " 的挑战
任务未到,先练起来。
反复练熟悉的题,收获可能有限;题目远超当前能力,也容易陷入低效尝试。选题要兼顾探索价值与现有方法的支撑。
默认每轮提出 10 个候选任务,按新颖性与能力边界评分的乘积选题:

其中,为候选任务集合。
新颖性看哪里练得少;能力边界评分看难度是否适合当前能力。
新颖性随尝试次数递减:

其中,为所需能力集合,

统计对应 " 情境—能力 " 的练习次数。图生图按源图区分情境,文生图使用统一标记。
对所需能力取平均,还能避免任务仅因包含更多能力,就获得更高的新颖性评分。
系统按调用与验证成功次数估计可靠性,取95%Wilson 置信区间下界;每项能力选最可靠的适用且未停用工作流。
任务能力估计由最薄弱的一项决定:

多步任务的短板,可能决定全局:某个关键环节缺少可靠方法,就会拖累最终结果。
再计算能力边界评分:

当 =0.5 时评分最高,能力估计接近 0 或 1 时评分降低,鼓励探索有基础、仍有提升空间的任务。
这里的是基于策略可靠性的能力估计,并非任务真实成功率。
第二步:边做边检查
系统先规划步骤与依赖,再将代码转换为 ComfyUI 工作流,验证流程可执行性、中间结果与最终输出。
中间验证尤其关键。如果红花已经偏离要求,继续用它生成花田,偏差可能沿流程传递。及时检查,才能尽早调整。
发现问题后,定位并修复失败环节,保留已验证部分;必要时调用子智能体,在有限重试内重新验证。
第三步:把经验留下来
成功流程抽象为策略;失败留下证据、原因和修正办法。系统持续更新可靠性、合并等价流程,让新经验参与下次选题与执行。
成功一次,也不意味着从此可靠。后续调用的成功与失败,会继续影响策略的可信度和复用优先级。
创意任务解决率 95%,提升在哪里?

在 ComfyBench 创意任务上,OmniHarness 解决率达 95%,比最强对照 SymbOmni 高27.5 个百分点;Codex GPT-4o 配置总体达 92.5%。
Pass 衡量工作流能否运行,Resolve 衡量结果是否满足要求。
两种配置的工作流运行通过率均为 100%;ComfyMind 和 SymbOmni 也已达到这一水平。因此,更值得看的是流程跑通后,究竟完成了多少任务。
同用 GPT-4o,OmniHarness 总体解决率为 89.5%,高于 ComfyMind 的 83%;创意任务为 95%,对照为 57.5%。
同用 GPT-4o 仍有提升,支持了整体框架的有效性,也让工具组织与经验复用成为值得进一步观察的因素。
换成 Codex 规划配置,总体解决率从89.5%升至92.5%,复杂任务从 76.7% 升至 83.3%,体现了规划配置对多步流程表现的影响。
复杂任务仍有进步空间:Codex 配置为 83.3%,略低于 ComfyMind 的 85%。
换个智能体、换成视频,经验还能用吗?



自主练习得到的策略库保持冻结,经知识接口适配交给其他智能体使用,保留宿主控制流程,不微调模型。
这份策略库既包含可复用的工作流模板,也包含失败证据与修正方法,供其他智能体通过自身的检索、规划和执行流程调用。
接入后,总体解决率变化如下:
ComfyAgent:32.5% → 57.0%。
ComfyMind:83.0% → 88.0%。
SymbOmni:86.0% → 89.0%。
创意任务解决率分别提升 27.5、17.5 和 10 个百分点。
三个系统在创意任务上的增幅,都高于各自的总体增幅。这提示,面对新的创作要求,可调用的方法和修正经验尤其值得重视。
只用图像任务练习得到的冻结策略库,还能参与视频生成。
视频总体解决率达85.9%,比表中最佳对照高5.1 个百分点;视频到视频任务达 80.0%,比该对照高 13.3 个百分点。
图像策略支持内容构建、参考保持等操作,视频专用组件处理时序,二者经适配和组合完成任务。
让每次实践,都留下方法
OmniHarness 让经验成为可积累、可复用的能力资源。自主练习与多轮检查仍有计算开销,后续需优化检索、验证与推理预算。
完成任务之后,还能留下些什么?OmniHarness 的回答是可验证、可调用、可继续修正的方法。让下一次行动接住上一次的经验,是这条研究路线的价值。
论文全文:https://arxiv.org/abs/2609.16057
项目主页:https://omniharness.github.io/
代码与运行说明:https://github.com/OmniHarness/OmniHarness
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系方式。
我们会 ( 尽量 ) 及时回复你 : )
点亮星标
科技前沿进展每日见


