← 返回目录
h2.3概念⏱ 约 10 分钟

参考图:从"描述"改成"给样品"

学完你会知道参考图真正省掉的是哪一类工作,以及它并不会让提示词变短

🔎 最后验证 2026-08📚 来源:Gemini 图像生成官方文档与编辑模板;本课对语料的结构化统计;本课语料中的配对样本🧰 Gemini 图像生成 API
为什么学这个

到目前为止,你给模型的所有条件都是文字。这一节加一种新的给法:直接给它一张图。

语料里有 25 条(11%)用了参考图。我原本以为它们会明显更短——毕竟画面内容都在图里了嘛。

数了一遍,不是。 用参考图的 25 条中位数 239 字,不用的 204 条中位数 237 字,几乎一模一样

这个结果比我原来的猜想有意思得多,它说明参考图省掉的不是字数,而是别的东西。

💡 打个比方

你去理发店。

只用嘴说:"两边短一点,上面留长,不要太碎,刘海不要齐……"说十分钟,还是有可能被剪成你不想要的样子。 拿张照片:"照这个剪。"三秒钟。

但注意接下来会发生什么:你拿了照片,通常还会补一句"但我不要他这个颜色""我发量没他多,你看着调整"。

照片没有让你少说话,它让你说的话变得精确了。 你从描述一个不存在的结果,变成了指着一个存在的东西说"改这里"。

参考图真正省掉的是什么

不是字数,是描述"说不清楚的那部分"的努力

有些东西用文字描述极其昂贵:一张脸长什么样、一件衣服的具体版型、一种很难命名的色调、一个复杂的构图。你可以写三百字,仍然不准。

参考图把这些一次性交付了。 于是你的文字可以全部用在“改什么”上,而不是“是什么”上。

看语料里最极端的例子——12 个字:

吉卜力风格
其他吉卜力风格
全部提示词只有 12 个字:“以吉卜力风格重绘这张照片”。参考图是那幅人尽皆知的名画。
🎨 生成这张图的提示词
以吉卜力风格重绘这张照片
注意它保留了什么、改了什么。**保留**:人物的姿态、双手交叠的位置、身后的远山与河流、构图与视线方向。**改了**:介质从油画变成动画赛璐珞、线条变成清晰的描边、色彩变成柔和的平涂、五官改成动画风格的大眼睛。**这 12 个字里没有一个字在描述画面内容**——内容全在参考图里,文字只负责说“换成哪种风格”。⚠️ 顺带一提:用一家动画工作室的名字当风格词,正是 h1.4 不建议依赖的那种写法,原因之一留到 h5.5 讲。
出图模型:Nano Banana / Gemini 图像生成作者:AnimeAI来源:awesome-nano-banana许可:CC BY 4.0

但这类"12 个字"的极短提示词只是少数。中位数告诉我们,大多数用参考图的人,文字一点没少写——他们把省下来的描述预算,花在了更精细的控制上。

官方给了六条编辑类模板

Gemini 官方文档把带参考图的用法单列成编辑类模板,一共六条。这六条基本覆盖了所有"给样品"的场景:

官方模板干什么讲它的那节
增删元素在原图上加一样、去掉一样本节
局部重绘(语义遮罩)只改指定的一处,别处不动h2.4
风格迁移保留构图,换成另一种风格本节
多图合成把几张图的元素拼成一张本节
高保真细节保留加东西的同时保证某处完全不变h2.4
草图完成化把草图变成成品本节

两条官方说明值得单独记住:

  1. 增删元素时,模型会自动匹配原图的风格、光线与透视。 你不需要再描述一遍原图长什么样。
  2. 局部重绘用"对话式语义遮罩",不需要像素级抠图工具。 你只要说"把桌上那杯咖啡换成茶",不用先去画一个选区。

第二条是这几年变化最大的一件事——它把原本属于修图软件的活儿,变成了一句话。

参考图能给几张:官方有明确上限

这是个具体的数字,直接影响你能做什么:

总计最多 14 张参考图,并且按用途分档(以 Pro 档为例):

类型Pro 档上限
物体参考图6 张
角色参考图5 张
风格参考图3 张

(Flash 档是 10 物体 + 4 角色 + 3 风格;Lite 档只有 10 张物体图。)

注意官方把参考图分成了三类:物体、角色、风格。这说明工具知道你给它这张图是干嘛用的——同一张图当"角色参考"和当"风格参考",效果完全不同。给图的时候说清用途,比多给几张更有用。

⚠️ 避坑以为给了参考图,模型就会“照着做”

参考图是条件,不是指令——h0.2 那条心智模型在这里同样成立。

三种常见的落空:

  1. 你以为它会保留的东西,它改了。 除非你明说"保持不变",否则模型不知道哪些是你在意的。语料统计里"保持不变约束"只有 3% 的人写——而这一格恰恰是配合参考图时最该写的。官方局部重绘模板里那句 Keep everything else in the image exactly the same, preserving the original style, lighting, and composition 就是干这个的,它是模板的一部分,不是可选的客套话
  2. 你以为它会改的东西,它没改。 参考图的"引力"很强,尤其是构图和姿态。想大改就得说得更重。
  3. 多张参考图互相打架。 给了三张风格图,三种风格不一致,结果是三者的平均——而平均往往谁都不像。

实用规则:每给一张参考图,配一句话说明"我要它的什么"。 是要它的构图?配色?人物长相?还是整体气质?不说,模型就全都拿一点。

🔧 动手做:把一条文字提示词改成"参考图 + 改动说明"(5 分钟)

  1. 从你手机相册里挑一张图——什么都行,一张自拍、一张拍歪的产品照、一张风景。
  2. 想清楚:你想让它变成什么? 换风格?换背景?加一样东西?去掉一样东西?
  3. 按这个结构写一句话:

"以这张图为参考,〔保留什么〕保持不变,把〔什么〕改成〔什么〕。"

  1. 关键的一步:把"保留什么"那一格填满。 想想哪些是你绝对不想被改掉的——人脸、logo、构图、比例、某个颜色。全部写出来。
  2. 对照官方局部重绘模板的写法自查一句:你有没有写出类似"其余部分完全保持不变,保留原有的风格、光线和构图"的话?没有的话,补上。

你会看到:第 4 步会让你意识到,自己其实有一堆"默认它不会动"的假设。把假设写成文字,是参考图用得好的关键。

为什么:参考图最大的风险不是它改得不够,是它改了你没打算让它改的地方——而这类问题往往在图看起来"还不错"的时候被忽略,等你放大细看才发现。

❓ 测验
语料统计显示:用参考图的 25 条中位 239 字,不用参考图的 204 条中位 237 字。这个结果说明?
❓ 测验
Gemini 官方对参考图的数量上限规定是?
✅ 小结

三句话收束这一节:

  1. 参考图不会让提示词变短(中位 239 vs 237)——它省掉的是描述"脸长什么样""什么版型"这类文字代价极高的信息,让你的字全部花在"改什么"上。
  2. 官方把带参考图的用法单列成六条编辑类模板;两条关键说明:增删元素时模型自动匹配原图风格光线透视,局部重绘用对话式语义遮罩、不需要抠图
  3. 参考图仍然是条件不是指令。每给一张,配一句"我要它的什么";并且把"保持不变"明确写出来——这一格语料里只有 3% 的人写,却是配合参考图时最该写的。

下一节把六条编辑模板里最实用的那条拆开讲:只改一处,别动其它。

下一节 → 局部重绘:改一处,别动其它
🔎 来源与核验· 6 条,点开核对
本节每个关键论断都对应一个可追溯的来源 —— 这是本课程"靠谱、不过时"的底线。
「229 条语料中 25 条(11%)使用参考图;用参考图者中位 239 字、不用者中位 237 字,最短一条 12 字」
📚 本课对语料的结构化统计(脚本 analyze-corpus.mjs,含阳性/阴性自检)✓ 已核验 2026-08
「Gemini 官方编辑类模板共六条:增删元素、局部重绘(语义遮罩)、风格迁移、多图合成、高保真细节保留、草图完成化」
「官方说明:增删元素时模型自动匹配原图的风格、光线与透视;局部重绘使用对话式语义遮罩,不需要像素级抠图工具」
📚 同上官方文档✓ 已核验 2026-08
「参考图总计上限 14 张;Pro 档 6 物体 + 5 角色 + 3 风格,Flash 档 10 + 4 + 3,Lite 档 10 张物体图」
📚 同上官方文档✓ 已核验 2026-08
「官方局部重绘模板含“Keep everything else in the image exactly the same, preserving the original style, lighting, and composition”」
📚 同上官方文档✓ 已核验 2026-08
「12 字风格迁移案例保留原作构图、姿态与背景,改变介质、线条、色彩与五官风格」
📚 本课语料中的配对样本(提示词与成品图同屏可核)✓ 已核验 2026-08
智图软件的赞赏码
都看到这了,打个赏呗!
接下来 · h2.4
局部重绘:改一处,别动其它
继续读下一节 →