角色一致性:目前仍然最难的那件事
学完你会用"外置设定 + 角色参考图"两条腿做一致性,并知道它的失效边界在哪
出一张好图是运气加结构。出十张里面是同一个人,是另一个难度等级的事。
这件事的需求非常普遍:做绘本、做漫画、做品牌人设、做一套产品海报里的同一个模特、给自己做一套不同场景的头像。而它也是目前 AI 出图最没有被彻底解决的问题。
语料里写了角色一致性要求的有 21 条(9%),不算多。但这个低比例不代表需求少——它更可能说明大多数人还没走到需要它的那一步。
这一节讲两条可行的路,以及一条你必须知道的边界。
你请人给你画一套四格漫画,主角是你自己。
做法一(靠嘴说):每一格都跟画师描述一遍"短发、圆脸、戴细框眼镜、左边有颗痣"。四格画完,四个人。因为"短发"有一百种短发。 做法二(给参考):第一格画好之后,把它给画师,说"后面三格照这个人画"。像多了,但画到侧脸、画到大笑,还是会飘。 做法三(先定设定):先画一张角色设定图——正面、侧面、背面,标好发型、五官比例、常穿的衣服。之后每一格都对着这张设定画。
第三种最费事,也最靠谱。 AI 这边的情况几乎一模一样。
一个能做到的例子:同一张脸,四个年龄
两条腿:外置设定 + 角色参考图
第一条腿:把角色设定外置。
不要指望模型"记住"你的角色——它不记得。每一次生成都是独立的一次,你上一张图里的人物,对下一张来说不存在。
所以要建一份角色设定文档,自己维护,每次原样粘进提示词。至少包含:
| 项 | 要写到什么程度 |
|---|---|
| 脸型与五官 | 圆脸/方脸、眼距宽窄、鼻梁高低、眉形、有没有痣疤 |
| 发型发色 | 长度、分缝位置、卷直、具体颜色 |
| 常穿 | 一套固定的衣服(换衣服是一致性最大的干扰源之一) |
| 体型 | 高矮胖瘦、肩宽 |
| 一个记忆点 | 一样独特的东西:一副特定的眼镜、一条围巾、一颗痣 |
最后那一行最有用。 一个足够独特的记忆点,能让观众"认出"这个角色,即使五官有细微漂移——观众认人靠的是显著特征,不是精确的几何比例。
第二条腿:用角色参考图。
h2.3 说过,官方把参考图分成三类,其中角色参考图是单独一类,有独立的额度:
| 档位 | 角色参考图上限 |
|---|---|
| Pro | 5 张 |
| Flash | 4 张 |
| Lite | 0 张(只支持物体图) |
注意最后一行。 最便宜的那一档根本不支持角色参考图——如果你的工作是做系列角色,选错档位等于这条腿直接没有。这是 h0.4 讲的"能力边界"在具体场景里的一次体现。
边界:什么时候它一定会飘
诚实交代几种已知会变难的情况。这些不是本课实测的结论,是从"一致性靠什么成立"推出来的——你可以自己验证:
- 换角度。 参考图是正面,你要侧面或背面——模型得"想象"没见过的那一面。
- 换表情幅度。 平静到大笑,五官形变很大。
- 多个角色同框。 特征容易互相串。
- 角色离得远、占画面小。 脸只有几十像素时,细节撑不住。
- 跨越多次生成的长序列。 每一次都有微小漂移,十张之后累积起来就不是同一个人了。
应对的思路是同一个:让每一次生成都尽量"看得见"前一次。
- 能同框就同框(像上面那个四年龄的例子);
- 不能同框,就把上一张当参考图带进去;
- 序列长的话,始终以最初那张设定图为参照,而不是以上一张为参照——否则误差会一代代累积。
这是个很自然但错误的推论:种子控制随机性,那固定种子不就能得到同一个人吗?
不能。h0.6 讲过,通义万相官方对种子的说明是"使用相同 seed 可使生成内容保持相对稳定"——它锁的是随机数的起点,不是画面内容。你只要改了提示词(而做系列图必然要改场景、动作、构图),画面就会整个不同。
种子在一致性这件事上唯一的用处是做对照实验:固定种子,只改角色描述里的一个词,看这个词有没有让脸更接近。它是测量工具,不是控制工具。
真正控制一致性的是这一节的两条腿:外置设定 + 角色参考图。
🔧 动手做:写一份角色设定卡(5 分钟)
哪怕你现在还不需要做系列图,这个练习也值得做一次。
- 挑一个角色——你自己、一个虚构人物、或者你想做的品牌形象。
- 按上面五项写下来:脸型五官 / 发型发色 / 常穿 / 体型 / 一个记忆点。
- 重点在第五项:想一个足够独特、一眼能认的东西。不要写"很有气质",要写"左眉尾有一道浅疤""总戴一副圆形金丝眼镜"。
- 把这五项拼成一段一百字左右的文字,存成一个可以随时复制的片段。这就是你的角色设定卡。
- 最后确认一件事:你现在用的工具/档位,支不支持角色参考图? 不支持的话,你只有"外置设定"这一条腿——那第 3 步的记忆点就更重要了。
你会看到:写到第 5 项时,你会发现自己想不出一个足够独特的记忆点。这本身就是一个信号——如果连你都说不出这个角色最显眼的特征是什么,模型更没办法把它稳住。
为什么:一致性不是靠某个咒语实现的,是靠你把角色变成一份可以反复原样输入的规格。这份规格越具体、记忆点越独特,一致性越稳——而这份规格由你维护,不由任何工具维护。
三句话收束这一节:
- 模型不记得你的角色——每次生成都是独立的一次。一致性靠外置设定(你自己维护的一份可复制的规格)加角色参考图两条腿。
- 角色参考图有独立额度:Pro 5 张、Flash 4 张、Lite 档 0 张;做系列角色时,档位选择是硬约束。
- 种子不是控制工具,是测量工具。 官方只说"相对稳定",而做系列图必然要改提示词。长序列要始终对齐最初的设定图,不要以上一张为参照。
下一节讲一致性的另一面:不是同一个人,而是同一套风格——它比角色一致性容易得多,而且有一个很好用的取巧办法。
🔎 来源与核验· 5 条,点开核对

