[AI书房] 第4章 全面掌握图像到图像
Nano Banana Pro实战提示词手册
第二部 提示词工程的基本功
第4章 全面掌握图像到图像
金京镇
Keep与Replace
图像到图像 (Image to Image) 简称 I2I。这项技术是以现有照片为基础创作新图的方法。Nano Banana Pro 的 I2I 功能被公认为全球评价最高的图像编辑工具。截至 2025 年,全球创作者已利用该技术生成了超过 50 亿张图像。
I2I 的核心原理分为两条指令。第一条是"Keep(保留)",第二条是"Replace(替换)"。
Keep 是告诉 AI"这部分不要动",Replace 是指示"只更换这部分"。将这两条指令结合使用,就能获得理想的效果。
编写指令时,顺序至关重要。先说明要保留的部分,再描述要更改的部分。AI 会认为前面的话更重要。Gemini 2.5 Flash Image 能够通过自然语言进行精准的局部编辑。例如,可以使背景模糊、清除 T 恤上的污渍、从照片中移除整个人,或者改变主体的姿势。
案例 A:仅更换背景
假设你有一张在房间里拍摄的自拍,想把它改成就像在巴黎埃菲尔铁塔前拍摄的一样。请尝试以下步骤。
1단계: 打开 Nano Banana 应用并上传照片。
2단계: 在提示词框中输入如下内容:"请保持人物不变(Keep the person exactly the same)。将背景更换为能看到巴黎埃菲尔铁塔的公园(Replace background with a park view of Eiffel Tower)。让光影效果自然融合。"
3단계: 点击生成按钮并查看结果。
这样操作后,你的面部和姿势会保持原样,只有背景的房间景色会变成巴黎的美丽街景。在 Instagram 上,利用该功能的"虚拟旅行照片"正风靡全球。
案例 B:仅更换服装
假设你有一张穿着普通 T 恤的照片,想把这件衣服换成帅气的西装。
1단계: 上传一张人物照片。
2단계: 编写如下提示词:"完美保持面部、发型和姿势(Keep face, hairstyle, and pose unchanged)。将穿着的 T 恤更换为黑色燕尾服西装(Replace t-shirt with a black tuxedo suit)。自然地表现出衣服的褶皱和质感。"
3단계: 如果结果中的衣服褶皱不自然,可以追加指令:"请把衣服褶皱修改得更自然一些。"
2025 年,时尚界正在推广利用该功能的"虚拟试穿"服务。在买衣服之前,可以先通过 AI 进行试穿。
案例 C:转换时段与季节
假设你有一张在晴朗白天拍摄的街道照片,想把它改成下雪的冬日夜晚。
1단계: 上传一张原始照片。
2단계: 编写如下提示词:"保持建筑和街道的形态(Keep the structure and composition intact)。将时段改为冬日夜晚并开启路灯(Change to winter evening with streetlights on)。增加下雪的气氛。"
3단계: 查看结果,如果光影或照明不自然,可修改为:"请将照明调得更暖一些。"
Gemini 可以通过自然语言对话进行多次图像编辑。这非常适合为了追求完美图像而进行的重复操作,或者共同探索各种创意。即便无法一次性获得完美结果,也可以像对话一样不断进行修改。
2. 无损修改原图的局部编辑秘籍
用 AI 编辑照片时,最担心的就是:"万一连我喜欢的部分也被毁了怎么办?"有一种技术不是重新绘制整张图,而是精准锁定并修改有问题的部分。这种技术被称为"局部重绘 (Inpainting)"。如果能用好局部重绘,就能在保留原图珍贵感觉的同时,天衣无缝地修改想要变动的地方。
第一个秘籍:备份原始文件。在开始编辑前,先单独保存原始文件。在文件名后标注 v1、v2 等编号来进行版本管理。即便不小心毁掉原图,也能随时重头再来。这个习惯是专业设计师必须遵守的基本原则。
第二个秘籍:一次只改一个地方。如果同时尝试更换背景、服装和表情,AI 会感到困惑。Gemini 在执行单一聚焦的指令时表现最佳。如果一次下达多个指令,通常只有一个能被正确执行。因此,建议先更换背景并保存,再更换服装并保存,表情则推迟到下一步。必须将复杂的编辑分解为有序的步骤。
第三个秘籍:把 Keep 句子写长。Keep 是"不应更改的内容清单"。如果写得太短,AI 就会有很大的随意发挥空间。编辑人物照片时,请详细写明"请保持面部、头发、肤色、姿势和手部形状不变"。Keep 描述得越短,Replace 的范围就越大。Replace 的范围越大,原图受损的可能性就越高。
第四个秘籍:把 Replace 句子写窄。Replace 最好只包含一个修改对象、一个位置和一个规则。例如,"将招牌文字改为'SALE',保持字体和背景不变",这种模式在文本替换中能产生稳定的结果。如果一次请求太多内容,结果往往不尽如人意。
第五个秘籍:加入位置线索。诸如"左下角"、"右上角"、"背景中央"、"人物后方"之类的表达非常有帮助。在 Nano Banana Pro 中,对于不直接选择区域的编辑,语言就起到了蒙版的作用。Gemini 2.5 Flash Image 利用自然语言实现精准的局部编辑。提供的方位越具体,AI 修改的位置就越准确。
第六个秘诀:请求自然连接。编辑中最容易出现突兀感的地方是边缘。新画的部分与原有部分相交之处会产生违和感。在 Replace 语句中加入"匹配光影、阴影和透视(Match lighting, shadows, and perspective)",能让新元素自然地融入现有场景。
第七个秘诀:准备细微修改的提示词。如果第一张结果有问题,只需用一句话修正。与其发出"让手部更自然"这种宽泛的指示,不如缩小范围,如"仅修改右手,其余保持不变"。此时也要分开使用 Keep 和 Replace。
第八个秘诀:区分局部重绘和扩展重绘。扩展重绘(Outpainting)是向画面外侧扩展的操作。局部重绘(Inpainting)是填补或更换画面内部分内容的操作。在扩展重绘中,"保持主体和构图不变,在边缘生成新内容"这种语句非常有效。混用这两项技术会导致混乱。
第九个秘诀:写下原始拍摄条件。简短记下镜头感、相机角度、景深、室内外情况。如果有"保持 85mm 人像镜头拍摄的感觉"、"保持自然光"这类信息,则只有修改部位会改变,照片的整体感觉能得以维持。如果没有这些信息,AI 可能会随意更改风格。
第十个秘诀:制定保存规则。将原图、编辑稿、最终稿分文件夹存放。在最终稿文件夹中,将使用的提示词以文本文件形式一同保存。下次进行类似工作时,可以复制该提示词使用。优秀的提示词就是财富。
3. 多图输入(最多 14 张)活用策略
Nano Banana Pro 拥有的强大武器之一是可以同时查看多张照片。Gemini 3 Pro Image 可以生成最高 4096 像素分辨率的图像,并能通过多个输入图像构建新场景或进行风格迁移。它最多可接收 14 张图像输入。这意味着你可以超越简单的命令,向 AI 教会"上下文"和"风格"。
第一项策略:按角色划分插槽。不要盲目放入 14 张照片,而是给每张照片赋予角色。1 号插槽是主体图像,放入人物、产品或主要角色。2 号插槽是风格图像,放入色调、材质或画风。3 到 8 号插槽是道具图像,放入包、鞋、道具 Logo 等元素。其余插槽是布局图像,放入海报构思或缩略图构思。
第二项策略:在提示词中直接使用图像编号。将"使用图像 1 作为主要主体(Use Image 1 as the main subject)"这句话放在第一行。如果没有这句话,AI 会猜测哪张照片是主角。猜测越多,一致性就越差。明确指定编号可以防止 AI 产生混乱。
第三项策略:按图像拆分 Keep。例如:"保持图像 1 中的人物不变(Keep the person from Image 1 unchanged)。""使用图像 2 中的服装(Use the outfit from Image 2)。""应用图像 3 中的色调(Use the color palette from Image 3)。"这种结构能减少角色冲突,因为每张图像负责的部分变得明确。
第四项策略:理解人物与物体的平衡。在 14 张图像中,需要考虑人物图像和物体图像的比例。人物图像用于保持一致性,物体图像用于实现高忠实度。操作顺序建议先固定人物,接着添加物体,最后应用风格。
第五项策略:将同类图像归类放入。人物照片应放在一起,并尽量减小角度差异。服装照片应放在一起,并放入背景简单的资料。产品照片应放在一起,并放入光影信息相似的内容。这样构图能让 AI 更容易整理。
第六项策略:用一句话固定目标。目标语句一行就足够了。例如:"将所有角色以相同的风格合并到一个客厅场景中(Combine all characters into one living room scene in the same style)"。如果用多句话罗列目标,AI 将无法确定优先级。
第七项策略:合成后再进行编辑。多图合成是第一步,第二步是 I2I 编辑。在第一步中获取整体构图,在第二步中修饰表情、手部、文本等细节。使用 Gemini 2.5 Flash Image,可以通过简单的提示词进行多种编辑,如模糊背景、去除 T 恤污渍或从照片中完全移除人物等。
第八项策略:快速分类失败原因。失败分为三类:主体改变的失败、道具混淆的失败、风格混杂的失败。主体失败通过增加 Keep 来解决,道具失败通过缩小 Replace 范围来解决,风格失败通过将风格图像减少到一张来解决。
第九项策略:将提示词分为声明、指示和约束。声明是"要创作什么",指示是"哪张图像用在哪里",约束是"要维持什么"。明确区分这三个部分能让提示词条理清晰。
第十项策略:将结果保存为资产。将用于合成的 14 张图打包在一个文件夹中,并与提示词一同保存。在将同一套角色移至其他背景时可以原样复用。这种重复操作能让系列创作成为可能。













