← Writing
光合制梦

如果 AI 生成的图片还能继续编辑呢?

最近在想,ChatGPT Work 的图片生成功能,以后能不能让模型在生成图片之后,也给用户提供一份可以继续编辑的版本,而不只是一张已经定型、所有元素都合并在一起的图片?

我今天在用 ChatGPT 生成 YouTube banner 的时候,再次强烈地感受到了这个需求。

其实模型最开始生成的图片已经离我想要的效果很近了。后来我想改的,不过是把宇航员和小太阳稍微移动一点,把标题往下挪一点,再调整一下文字的大小、间距,以及文字外面那一圈发光圆弧的位置,让整个画面更适合 YouTube 的裁切范围。

如果图片里的元素可以被单独选中,我可能自己拖动几下就可以完成了。但因为最终得到的是一张无法编辑的图片,我没有办法直接调整其中的文字、人物和装饰元素,只能继续用语言告诉模型哪里需要变化。

于是我说“宇航员再往里面一点”,模型重新生成一张;我说“标题再往下一点”,它又重新生成一张…但每次重新生成时,不只是我想修改的部分可能发生变化,原本已经满意的字体、圆弧、人物比例和画面细节,也可能一起变化。

最后我们来回调整了 7 次,第四个版本整体上最接近我想要的效果,但因为我觉得它还可以把细节处理得更好,于是我们又尝试了三次,结果…是我期待太高了😂其实版本四也还不错了。

这让我想起很久以前试用 Replit 时遇到过的一个很相似的问题。

当时 Replit 可以根据语言生成一个网页或产品界面,但当我想修改某些文字的大小、颜色、排版和具体位置时,我没有办法直接在界面里调整,只能继续和 Agent 描述我想要的效果。

可是视觉上的感觉有时候很难完全通过语言说清楚,传达给 AI 的语言总和脑海里的想象之间隔着距离。即使我已经尽量具体地描述了,它做出来的效果和想象的样子仍有出入。于是我只能反复修改、反复沟通,最后消耗了很多时间和额度,也越来越烦躁。后来我干脆把整个项目下载下来,放进 VS Code,再交给其他 coding agent 继续处理。

到了今年 3 月,我看到 Replit Agent 4 开始让生成出来的一些界面变得可以直接编辑。尽管再次试用时觉得效果还没有特别成熟,但我依然觉得,这是一个很好的方向。

因为它不再是要求用户只能通过 Agent 间接控制一切创造,而是让 AI 先生成一个大致的结构和视觉方向,然后再允许人直接参与其中一些更具体的环节。

我觉得这也是 human in the loop 非常重要的一部分。

尤其是对于并不是专业从事设计或绘画的人来说,语言大概仍然是最直接的意图传达工具。当我们看到一张图时,会凭自己的直觉和判断说:“这里好像有点挤”“这个标题可以再往下一点”“宇航员再往里面一点看起来更平衡”。

我们未必会下意识地打开绘图工具,把理想的位置和效果画出来,也未必知道应该使用什么专业术语——通过语言告诉模型自己的感受和大致方向,对很多普通用户来说,应该是最容易也最常用的方式。

但当模型已经生成了一个大致满意的结果之后,继续用语言完成所有细微调整,好像又不是最合适的方法。

语言适合描述意图、感觉和方向,却不一定适合处理“向左边移动一点”“把字号调小一点”“只修改这个元素,其他部分保持不变”这样的操作。

所以 echo 开头提到的,ChatGPT Work 未来能不能在生成图片之后,提供一种可以继续编辑的形式?

比如说,文字是可以修改的文字图层;人物、圆弧、背景和装饰元素可以被单独选中、移动和缩放;用户可以锁定已经满意的部分;需要重新生成时,也可以只重新生成被选中的那个元素,而不是重新生成整张图片。

也许它还可以提供 YouTube、X、Instagram 等不同平台的安全区域,或者允许用户把生成结果导出到 Figma、Canva、SVG、PSD 或其他可以继续编辑的格式里。

我不太确定在技术上实现这些功能会有多难,也不知道 ChatGPT Work 团队是不是已经在考虑类似的方向。但从我的使用体验来看,我会很需要这样的能力。

AI 可以帮助我生成原本很难独立完成的视觉方向、画面氛围和初始版本,而当结果逐渐接近我想要的样子时,我也希望自己能够直接接管那些很具体的修改。等到我再次需要新的创意、元素或方案时,再把工作交还给 AI。

对我来说,这会比“所有修改都继续通过语言请求模型完成”,都更接近我所理解的“人与 AI 如何协作”。而且我觉得,独属于人的审美和判断不仅仅体现在审核和确认 AI 交付的结果上,还有“稍微动一点点就觉得哇更对味儿了的那种探索直觉”。

也就是 AI 最终交付给人的,或许可以不只是一张已经完成的图片,也可以是用户仍然能够理解、接管并继续修改的创作状态。

那么,这种功能有可能成为 ChatGPT Work 未来的一部分吗?👀

输入文字,搜索文章和 Voice Notes。