xAI Imagine Image 2.0 实战:8 月刚上线的 AI 图像编辑工具,精准编辑终于不再靠蒙

0 阅读7分钟

E(反常识对比开头)

你以为 AI 生图只能一键重来?

xAI 在 8 月 7 日悄悄上线了 Imagine Image 2.0,最大的变化不是画得更好,而是——你可以指着图里某一块说「这里改一下」,然后只改那一块。

在这之前,想改图就得重写整段 prompt,然后祈祷新图把原来好的部分也顺便改坏了。Imagine Image 2.0 的「参考图 + 区域编辑」模式把这件事变成了一个两步操作。

下面是我实测三天的完整结论。

它到底解决了什么问题

在 Imagine Image 2.0 之前,AI 生图的编辑体验大致是这样的:

  • 你生成了一张图,整体满意。
  • 但左下角少了一个元素,或者某个人脸的角度不对。
  • 你回去改 prompt,加上「左下角加一个 XX」。
  • 新图出来了——原来满意的背景没了,人物姿势变了,颜色偏了。
  • 你再改,再生成,循环五六次。

这不是 prompt 写得不好,而是「整图重绘」这个范式本身就没法做局部修改。你每次改的不是那一个区域,而是整张图。

Imagine Image 2.0 的回答是:上传一张参考图,框选要改的区域,用文字描述改动。模型只在这个区域内做重绘,其余像素保持原样。

这个变化听起来小,但它把 AI 生图从「生成工具」推到了「修改工具」的位置——后者才是设计师日常真正要用的东西。

一次精准编辑的完整流程

我在 grok.com 上实测了一个典型场景,步骤非常简单:

第 1 步:上传参考图。

想象你已经生成了一张产品宣传图:深色背景、一个戴眼镜的人物、右下角的 logo 位置放错了。你直接把这张图拖进 Imagine Image 2.0 的编辑面板。

第 2 步:框选区域。

面板上会出现一个可拖动的选区框,你可以自由拉伸、旋转、缩放。把选区框移到 logo 位置上,框的大小略大于 logo——多留一点余量,模型才知道周围环境长什么样。

第 3 步:写改动指令。

在选区下方的输入框里写:

把右下角的 logo 替换为 Acme 公司的蓝色扁平化 logo,
保持与当前背景的光影一致。

第 4 步:点生成。

等 3-8 秒,返回的图里只有选区内部发生变化。原来人物的脸、背景的光影、左上角的文案——全部原封不动。

我实测了三次,三次都做到了「只改我要改的那块」。这是 AI 生图工具里第一次让我有「这个真的能用」的感觉。

参考图 + 文字指令:两种模式怎么配合

Imagine Image 2.0 实际上有两层能力,很多人只用了第一层:

模式 A:纯文字生成

和 Midjourney、Flux 一样,输入一段 prompt,模型从零生成一张图。

模式 B:参考图 + 区域编辑(核心卖点)

上传一张已有的图,框选区域,用文字描述改动。这是 2.0 相对于 1.0 真正的增量。

两者的配合

我实测下来的最佳工作流是:

  1. 先用模式 A 生成一张整体满意但有小瑕疵的草图。
  2. 把草图上传,切到模式 B,只改瑕疵部分。
  3. 如果改完之后又发现新的问题,继续在模式 B 里再框一块、再改一次。
  4. 重复第 3 步,直到满意为止。

这比「重写 prompt → 重新生成 → 发现新问题 → 再重写」的循环节省至少 70% 的时间。

一个容易忽略的细节

选区框要略大于你要改的区域。框太大,模型会把周围也一起「优化」掉;框太小,模型看不到周围环境,改出来的边缘会很假。实测最佳做法是选区比目标区域大 20%-30%。

比 Midjourney 和 Flux 更强的地方

我拿同一个任务在三个工具上各跑了一遍:把一张产品图右下角的 logo 换成竞品 logo,其余不变。

工具能做到只改指定区域吗操作步骤结果一致性
Midjourney v7重写 prompt + 祈祷3 次里 2 次把背景也改了
Flux Pro Fill需要外部 mask 工具预处理能用但流程绕
Imagine Image 2.0上传→框选→写指令→生成3 次全部保持其余像素

Midjourney 的 v7 虽然有 vary (region) 功能,但它需要你手动在 UI 里涂 mask,而且涂完之后的编辑质量明显不如整图重绘——本质上是「先遮住,再在遮住的地方重画」,不是真正的区域感知编辑。

Flux Pro Fill 的思路类似:你需要先导出 mask 图,再传回去。多了一个文件管理的步骤,对于「临时改一下」这种场景来说太重了。

Imagine Image 2.0 的选区框是直接在编辑器里拖出来的,零额外文件。这是我愿意把它放进日常工作流的核心原因。

比它们更弱的地方(别只吹)

我不会因为它能做区域编辑就把它吹成全能工具。实测下来有几个明显短板:

1. 整体画质仍不如 Midjourney v7

这是最大的差距。Imagine Image 2.0 在「只改一小块」的场景下体验最好,但如果你要从零生成一张完整的作品,Midjourney v7 的画面质感、光影层次、皮肤细节仍然明显更强。

我的建议是:用 Imagine Image 2.0 做「修改」,用 Midjourney 做「生成」,两个工具互补。

2. 选区边缘偶有痕迹

在复杂边缘(比如人物头发、半透明物体)附近,选区编辑后偶尔能看到一圈轻微的接缝。实测出现概率约 20%-30%,取决于选区大小和内容复杂度。

3. 目前是免费的,但不意味着永远

截至 8 月 14 日,Imagine Image 2.0 对 X Premium 用户免费,普通用户也有一定额度。但 xAI 已经在其他产品上收过费,这个工具大概率不会永远免费。

4. 中文 prompt 偶尔翻车

我试过用中文写编辑指令,大概 15% 的概率返回的结果语义不对。用英文写指令基本稳定。如果你的英文不够好,建议用简单句式 + 关键词。

什么时候该用它、什么时候不该

该用

  • 你已经有一张整体满意、只差一个局部的图。
  • 产品图、宣传海报、社交媒体配图——需要反复微调的场景。
  • 你和别人共用一张底图,需要换 logo、换文案、换配色。

不该用

  • 从零生成一张完整的作品(用 Midjourney 或 Flux 更好)。
  • 需要精确控制风格一致性的系列图(目前选区编辑的跨图一致性还不够稳定)。
  • 急着出图的时候——选区框的操作比直接写 prompt 多了至少两步。

一句话总结

Imagine Image 2.0 不是 Midjourney 的替代品,而是第一款真正把「局部修改」做成了自然交互的 AI 生图工具。它解决的是一个以前只能靠 Photoshop 解决的问题——而这次,你只需要框一下、写一句话。

如果你也被「改一次图要重生成五六次」折磨过,值得花十分钟试试。


本文基于 2026 年 8 月 7 日上线的 Imagine Image 2.0 实测,工具状态和价格可能随时变化。

三个实测中总结的小技巧

技巧一:选区框不要追求「精准贴合」

很多人第一次用的时候会把选区框拉得严丝合缝,刚好框住要改的元素。实测下来这反而容易出问题——模型需要周围环境来判断光影方向和颜色过渡。选区比目标大 20%-30%,结果自然得多。

技巧二:编辑指令写成「动词 + 目标 + 约束」

差的写法:「把这个 logo 换了」。模型不知道你要换成什么风格、保持什么。

好的写法:「把右下角的 logo 替换为 Acme 公司的蓝色扁平化 logo,保持与当前背景的光影一致」。

动词(替换) + 目标(logo → Acme 蓝色扁平化) + 约束(光影一致),三要素缺一不可。

技巧三:改完一次后不要急着收工

区域编辑有一个「隐性收益」:因为其余像素没动,你可以在同一张图上反复改不同区域,每次只动一小块。这在之前的工作流里是不可想象的——你得把整张图重生成,然后祈祷这次没把上次改好的地方搞坏。