科技狐 昨天
从“会生成”到“精准修改”,OpenAI 把 AI 生图做得更像工具了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

现在的   OpenAI,算是把流量玩明白了。

9   月   9   日凌晨,他们宣布通过使用   OpenAI   的下一代模型,让将近一万个   Agent   协同工作,解决了困扰科学界近   90   年,并被列为千禧年七大难题之一的维纳尔斯托克斯方程。

这个消息一出,立即震撼了科学界、科技界,引起众多讨论,赚足了眼球。

紧接着,OpenAI   宣布他们最新的生图模型   ChatGPT Image-2.5   上线。

关于   AI   解决维纳尔斯托克斯方程这事,科学界、科技界后续会有更多有意思的观点,老狐还要学习吸收一下,咱们后续再聊。

这里先介绍最新发布的   ChatGPT Image-2.5,也许它将会对你的工作产生更大帮助。

Image-2.5   在多个方面得到了升级,相比于   ChatGPT Image-2.0,Image-2.5   能够呈现更自然的光照和更丰富的纹理,也能够更好地保留参照物中的主体,如果大家生成图片时有上传参考图片,就会懂得这个功能的含金量。

在   Image-2.5   上,OpenAI   还增加了 "Sketch" 这项重磅功能,用户可以直接在画板中绘制自己想要的草图,提供给   Image-2.5   参考。

此外,Image-2.5   还引入了模板功能,用户可以参考模板的提示词,更加轻松地完成图像创作;生成的图片,用户可以直接编辑,在图片上注释,做出更精准的调整,用于生成图片的提示词,也支持分享。

而且   Image-2.5   在多轮编辑一致性方面也有了提升,经常用大模型做图的就知道,你本来是想修改图片的 A   处,其他不变,但生成的新图大模型却把   B   处、C   处都改了,而   Image-2.5   正是针对这一痛点,进行了改变,提升了多轮编辑的一致性。

比如下面这组动图,就是由 OpenAI   官方的视频素材制作而来,由   Image-2.5   多张生成图片合成,画面只有蜡烛依次点燃,没有其他地方修改。

因此,如果你要制作定格动画,Image-2.5 是一个更好的工具。

以上都是   OpenAI   官方的描述,实际体验如何呢,我们进行了一个实测。

我们用 Sketch   功能,简单画了一张上面科技狐的 logo,然后让   Image-2.5   以这个画面作为主体,生成一个有立体感的科技狐公众号封面,并且在图里面要体现由   Image-2.5   生成的元素,背景是写实风格。

下图就是生成的结果。

可以见到,在光影效果方面,Image-2.5   可以呈现出非常自然的效果,折角处的反光,背光处的反射都符合真实物理世界规律,立体的字体会有一种黑色塑料的质感,包括桌面的木质纹理也比较丰富。

我们还可以在这张照片基础上进行进一步修改,包括在图上标注、评论、移除背景、擦除等等。

不知道大家伙觉得如何,Image-2.0   本身就非常强大,Image-2.5   不管是画质表现确实更好,还提供了更多的实用工具。

当然了,老狐这个绘画技术还有待提高,我们可以借用网上大量博主的测试,看看   Image-2.5   的表现如何。

比如   Sketch   功能,博主先是在绘画板上画了一个可爱的云朵形象,再提出了更多的细节要求,结果如下图。

对于有一定绘画基础的用户来说,简单画个模板,Image-2.5   就可以生成一个理想的图片,这确实要更加便捷。

也有网友展示了一件换衣功能,在换掉衣服后,发型、脸、皮肤、姿势、手和周围的环境都没有发生变化。

出色的多轮编辑一致性,除了能制作定格动画,还可以用于服装行业,帮助品牌或电商快速展示服饰,模特只需要拍摄固定的姿势,所有服装都能应用上。

也有很多博主把   Image-2.5   跟   Image-2.0   生图拿来做了对比。

在下面这张图片里,Image-2.5 的衣服质感更真实,背景的灯带更合乎真实物理逻辑,而   Image-2.0 的灯带是交错的,没有人会这样建造建筑。

在下面这一组人物对比图里,同样如此,Image-2.5   生成的图片,也要比   Image-2.0   细节更丰富,更重要的是   AI   味没有那么浓。

*Image-2.5

*Image-2.0

从这些场景来看,Image-2.5   都要比   Image-2.0   表现更好,足以见得图片生成模型的进步,但也有不少博主在实测中发现翻车了。

比如在下面这组图片坐在镜子前面理发的场景中,不管是   Image-2.0   还是   Image-2.5   都翻车了,前者的样张,理发师正对着镜子,但是镜子里的理发师露出背面,这不合理。

而   Image-2.5   更不合理,理发师和顾客们都是背对着的。

由此可见,在一些需要理解物理规律的场景下,生图模型还是容易翻车。

此外,一些经典的生图模型会产生的问题,有博主在尝试时也出现了,比如下面这张图。

但不可否认的是相比上一代 Image-2.0,Image-2.5 有了提升。不过在使用时,给老狐印象更深的还是工具的提升,以及在特定场景的功能优化。

新增 Sketch 的功能,还有支持对图片进行更精准地修改,这不是模型能力的提升,而是周边工具的优化,但显著改善了使用体验。

而像多轮编辑一致性这种能力,也可以想象对定格动画创作者来说是有显著帮助的,服饰从业者也能从中受益。

从某种程度上来说,如今的 AI,模型性能提升对用户的感知可能不太明显,但如果能围绕模型开发更好用的工具,并且让工具有用武之地,这对用户体验的改善十分明显,作用不比模型能力提升来的少。

汽车的发动机固然重要,但怎么造好轮子,怎么做好内饰,也是成功的关键因素。

编辑:木易

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

维纳
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论