← 返回目录
h2.5概念⏱ 约 9 分钟

角色一致性:目前仍然最难的那件事

学完你会用"外置设定 + 角色参考图"两条腿做一致性,并知道它的失效边界在哪

🔎 最后验证 2026-08📚 来源:Gemini 图像生成官方文档;本课对语料的结构化统计;本课语料中的配对样本🧰 Gemini 图像生成 API
为什么学这个

出一张好图是运气加结构。出十张里面是同一个人,是另一个难度等级的事。

这件事的需求非常普遍:做绘本、做漫画、做品牌人设、做一套产品海报里的同一个模特、给自己做一套不同场景的头像。而它也是目前 AI 出图最没有被彻底解决的问题。

语料里写了角色一致性要求的有 21 条(9%),不算多。但这个低比例不代表需求少——它更可能说明大多数人还没走到需要它的那一步。

这一节讲两条可行的路,以及一条你必须知道的边界。

💡 打个比方

你请人给你画一套四格漫画,主角是你自己。

做法一(靠嘴说):每一格都跟画师描述一遍"短发、圆脸、戴细框眼镜、左边有颗痣"。四格画完,四个人。因为"短发"有一百种短发。 做法二(给参考):第一格画好之后,把它给画师,说"后面三格照这个人画"。像多了,但画到侧脸、画到大笑,还是会飘。 做法三(先定设定):先画一张角色设定图——正面、侧面、背面,标好发型、五官比例、常穿的衣服。之后每一格都对着这张设定画。

第三种最费事,也最靠谱。 AI 这边的情况几乎一模一样。

一个能做到的例子:同一张脸,四个年龄

信息图 / 教育视觉图 - 男性年龄演变肖像
人像 / 写真信息图 / 教育视觉图 - 男性年龄演变肖像
同一个人的四个年龄段,拼成一张。中间三处是硬切的分界线,而两侧的脸要让人认出是同一个人。
🎨 生成这张图的提示词
创建一个超写实的年龄演变肖像序列,展示同一位男性在 {argument name="stages" default="4 个主要生命阶段:儿童(6 岁)、青年(25 岁)、中年(45 岁)和老年(75 岁以上)"} 的变化。使用附带的儿童面部照片作为最年轻阶段的精确身份参考,确保每个年龄阶段看起来都是同一个人随时间自然衰老的结果,并在所有年龄段中保持一致的面部结构、鼻型、眼睛颜色、下颌线、肤色、眉形、嘴唇和面部比例。将四张面孔以紧凑的重 …
它成立靠的是**把一致性收进同一张图里**——四个年龄同框,模型在一次生成中同时处理它们,可以互相参照。仔细看能验证它确实做到了:**眉骨的形状、鼻梁的走向、下巴的轮廓、眼距**在四段之间是连贯的,变的是皮肤松弛度、发色、发际线和肌肉量。**但这也正好说明了它的局限**:这是“一次生成内部的一致性”,不是“跨多次生成的一致性”——后者难得多。
出图模型:Nano Banana / Gemini 图像生成作者:Nexora来源:YouMind许可:CC BY 4.0

两条腿:外置设定 + 角色参考图

第一条腿:把角色设定外置。

不要指望模型"记住"你的角色——它不记得。每一次生成都是独立的一次,你上一张图里的人物,对下一张来说不存在。

所以要建一份角色设定文档,自己维护,每次原样粘进提示词。至少包含:

要写到什么程度
脸型与五官圆脸/方脸、眼距宽窄、鼻梁高低、眉形、有没有痣疤
发型发色长度、分缝位置、卷直、具体颜色
常穿一套固定的衣服(换衣服是一致性最大的干扰源之一)
体型高矮胖瘦、肩宽
一个记忆点一样独特的东西:一副特定的眼镜、一条围巾、一颗痣

最后那一行最有用。 一个足够独特的记忆点,能让观众"认出"这个角色,即使五官有细微漂移——观众认人靠的是显著特征,不是精确的几何比例。

第二条腿:用角色参考图。

h2.3 说过,官方把参考图分成三类,其中角色参考图是单独一类,有独立的额度:

档位角色参考图上限
Pro5 张
Flash4 张
Lite0 张(只支持物体图)

注意最后一行。 最便宜的那一档根本不支持角色参考图——如果你的工作是做系列角色,选错档位等于这条腿直接没有。这是 h0.4 讲的"能力边界"在具体场景里的一次体现。

边界:什么时候它一定会飘

诚实交代几种已知会变难的情况。这些不是本课实测的结论,是从"一致性靠什么成立"推出来的——你可以自己验证:

  1. 换角度。 参考图是正面,你要侧面或背面——模型得"想象"没见过的那一面。
  2. 换表情幅度。 平静到大笑,五官形变很大。
  3. 多个角色同框。 特征容易互相串。
  4. 角色离得远、占画面小。 脸只有几十像素时,细节撑不住。
  5. 跨越多次生成的长序列。 每一次都有微小漂移,十张之后累积起来就不是同一个人了。

应对的思路是同一个:让每一次生成都尽量"看得见"前一次。

  • 能同框就同框(像上面那个四年龄的例子);
  • 不能同框,就把上一张当参考图带进去;
  • 序列长的话,始终以最初那张设定图为参照,而不是以上一张为参照——否则误差会一代代累积。
⚠️ 避坑以为“同一个种子”能锁住角色

这是个很自然但错误的推论:种子控制随机性,那固定种子不就能得到同一个人吗?

不能。h0.6 讲过,通义万相官方对种子的说明是"使用相同 seed 可使生成内容保持相对稳定"——它锁的是随机数的起点,不是画面内容。你只要改了提示词(而做系列图必然要改场景、动作、构图),画面就会整个不同。

种子在一致性这件事上唯一的用处是做对照实验:固定种子,只改角色描述里的一个词,看这个词有没有让脸更接近。它是测量工具,不是控制工具。

真正控制一致性的是这一节的两条腿:外置设定 + 角色参考图

🔧 动手做:写一份角色设定卡(5 分钟)

哪怕你现在还不需要做系列图,这个练习也值得做一次。

  1. 挑一个角色——你自己、一个虚构人物、或者你想做的品牌形象。
  2. 按上面五项写下来:脸型五官 / 发型发色 / 常穿 / 体型 / 一个记忆点
  3. 重点在第五项:想一个足够独特、一眼能认的东西。不要写"很有气质",要写"左眉尾有一道浅疤""总戴一副圆形金丝眼镜"。
  4. 把这五项拼成一段一百字左右的文字,存成一个可以随时复制的片段。这就是你的角色设定卡。
  5. 最后确认一件事:你现在用的工具/档位,支不支持角色参考图? 不支持的话,你只有"外置设定"这一条腿——那第 3 步的记忆点就更重要了。

你会看到:写到第 5 项时,你会发现自己想不出一个足够独特的记忆点。这本身就是一个信号——如果连你都说不出这个角色最显眼的特征是什么,模型更没办法把它稳住。

为什么:一致性不是靠某个咒语实现的,是靠你把角色变成一份可以反复原样输入的规格。这份规格越具体、记忆点越独特,一致性越稳——而这份规格由你维护,不由任何工具维护。

❓ 测验
Gemini 各档模型中,Lite 档支持的角色参考图数量是?
❓ 测验
做一个十张图的长序列时,本节建议每一次都以什么为参照?
✅ 小结

三句话收束这一节:

  1. 模型不记得你的角色——每次生成都是独立的一次。一致性靠外置设定(你自己维护的一份可复制的规格)加角色参考图两条腿。
  2. 角色参考图有独立额度:Pro 5 张、Flash 4 张、Lite 档 0 张;做系列角色时,档位选择是硬约束。
  3. 种子不是控制工具,是测量工具。 官方只说"相对稳定",而做系列图必然要改提示词。长序列要始终对齐最初的设定图,不要以上一张为参照。

下一节讲一致性的另一面:不是同一个人,而是同一套风格——它比角色一致性容易得多,而且有一个很好用的取巧办法。

下一节 → 风格一致性与品牌规范
🔎 来源与核验· 5 条,点开核对
本节每个关键论断都对应一个可追溯的来源 —— 这是本课程"靠谱、不过时"的底线。
「229 条语料中 21 条(9%)含角色一致性要求」
📚 本课对语料的结构化统计(脚本 analyze-corpus.mjs,含阳性/阴性自检)✓ 已核验 2026-08
「参考图按物体/角色/风格分类并各有上限:Pro 6+5+3、Flash 10+4+3、Lite 仅 10 张物体图」
📚 Gemini API 图像生成官方文档✓ 已核验 2026-08
「通义万相对 seed 的官方说明为“使用相同 seed 可使生成内容保持相对稳定”」
「同一人物四个年龄段同框的成品图中,眉骨形状、鼻梁走向、下巴轮廓与眼距在四段之间连贯」
📚 本课语料中的配对样本(成品图可核)✓ 已核验 2026-08
「换角度、大幅表情、多角色同框、主体占比小、长序列累积漂移这五种情况会加大一致性难度」
📚 本课依据“一致性靠参照成立”所作的推论,非实测结论(课内已标注)✓ 已核验 2026-08
智图软件的赞赏码
都看到这了,打个赏呗!
接下来 · h2.6
风格一致性:比角色一致性容易,而且有个取巧办法
继续读下一节 →