毫无疑问,四月份发布的生图模型 GPT-Image-2,现在依然是当之无愧的 AI 生图之王。
无论是各种复杂的信息图,还有普通用户用来做一些简单的 PS,到处都有 GPT-Image-2 的痕迹。
一般的生图模型想要突出重围,光拼质量肯定不够。这几天,马斯克在 X 上疯狂推广的 Imagine Image 2.0 就凭借着能做表情包出圈了。

这款新的生图模型,在大模型竞技场上,文本转图像生成和图像编辑两个类别均位列世界第二。

除了老生常态的用 AI 生成各种文字密集的信息图、广告、游戏素材、UI/UX 模型、故事板等等,Imagine Image 2.0 这次的重点是支持可交互的精准编辑。

上传一张图片,Grok 会自动将图片进行分层,我们可以精确选择图像中的特定区域进行修改。
就像这张维基百科的表情包,Grok 分析之后的分段包括地球的每一块碎片,以及下面举着地球的任务,也被分成了仅人脸和包含手势动作两个图层。

而点击图层右侧的下载按钮,就可以直接将图片中的任意主体导出为透明背景。此外,魔棒工具可以编辑我们涂画的区域,做到自动分层覆盖不了的区域。
多张图片的编辑融合,Imagine Image 2.0 也能做到,多参考编辑功能一次最多可处理 5 张输入图像,实现自动拼接。





京公网安备 11011402013531号