AI 出图到底在做什么:它不是在执行命令
学完你会用"条件"而不是"命令"来理解提示词,并看懂图里那些你没要求的东西
很多人第一次用 AI 出图,心里想的是"我下了一道命令,它去执行"。这个理解会让你在头一百张图里持续挫败:你说了不要的东西它偏画,你没说的东西它自作主张加上,同一句话跑两遍出来两个样。
这一节不讲扩散模型的数学,讲一个更管用的东西:把提示词理解成"条件"而不是"命令"。 换掉这一个词,后面十来个"为什么它不听话"会同时得到解释。
我们从一张图开始——而且是从这张图里没人要求过的那部分开始。
你去照相馆,跟摄影师说:"我要一张雨天车站的水彩画感觉的照片。"
摄影师不会问你"车站牌子上写什么字"。他会自己找一个像那么回事的车站,牌子上原本写什么就写什么——因为牌子上的字不在你的要求里,但一个车站不可能没有牌子。
AI 出图是同一回事,只是更极端:它不但会补上牌子,还会补上看起来像字、但其实不是字的东西。因为在它见过的几亿张车站照片里,那个位置总有一块字形状的东西。
从这张图里你没要求的那部分说起
这块乱码牌子是理解 AI 出图最好的入口。它说明了三件事:
一、模型补全的是"像不像",不是"对不对"。 它见过的车站照片里,遮雨棚下方总有一块牌子,牌子上总有深色的字形。于是它给了你一块牌子和一片字形。至于那些字形拼起来是不是一个词——在"像不像一张车站照片"这个尺度上,不重要。
二、你没说的部分,它一定会替你填。 一张图有几百万个像素,你的提示词只有几十到几百个字。中间巨大的空白由模型按"通常长什么样"补齐。这不是 bug,这是它必须做的事——否则它没法输出一张完整的图。
三、所以提示词是条件,不是命令。 你写的每一句话,都是在缩小"什么样的图算合格"的范围。你写得越具体,合格范围越窄,出来的图越接近你想的;你留白越多,模型自由发挥的地方越多。
换个词,十个问题一起解释
把"命令"换成"条件"之后,几个常见困惑当场变形:
| 你的困惑 | 用"条件"重新理解 |
|---|---|
| 同一句话跑两遍不一样 | 符合同一组条件的图有无数张,它每次给你其中一张 |
| 我说了"不要文字",还是有文字 | 你加了一个条件,但"像海报"这个条件本身强烈要求有文字,两个条件在打架 |
| 我写"高级感"没用,写"哑光黑色金属"就有用 | 前者不能缩小范围(什么图都能自称高级),后者能 |
| 我加了一堆形容词,图反而更乱 | 条件之间互相冲突时,模型只能各让一步 |
这也是本课后面所有内容的地基:H1 教你把"想要的画面"拆成一组能缩小范围的条件,H2 教你在条件之间冲突时怎么办。
内部机制:两条路线,而且有一条官方没公开
到这里要停一下,说一句诚实的话。
市面上讲"AI 绘画原理"的内容,基本都在讲扩散模型:从一团随机噪点开始,一步步去掉噪声,最后显出一张图。这个描述对 Stable Diffusion、FLUX 这条路线是成立的,它们的做法有公开论文可查。
但本课语料用的 Nano Banana / Gemini 系列不属于那条路线,它是把图像生成长在大模型里的"原生多模态"做法。官方文档提到过图像编辑走的是"推理与生成结合的过程",也提到 Pro 档有思考模式——但它内部到底怎么生成像素,官方文档没有公开。第三方的说法互相矛盾,本课不猜。
那这一节讲的东西还成立吗?成立,因为它不依赖机制。"提示词是条件不是命令"是从可观察的行为归纳出来的——你没要求的牌子出现了、你要求过的东西有时没出现、同一条提示词出两张不同的图。这些现象在两条路线上都成立。
这是网上教程最常见的一类错误:用扩散模型的机制,去解释一个不是扩散模型的工具为什么这样那样。
一个具体的后果:"负面提示词"并不是通用概念。 通义万相的官方 API 有一个独立的 negative_prompt 字段,官方说明是"用来描述不希望在画面中看到的内容";而 Gemini 的图像生成没有这个字段,你只能在正向提示词里用语义否定("移除背景里的车")。
如果你信了"AI 绘画都要写负面提示词",到了没有这个字段的工具上,你会写出一堆不知道被怎么处理的话。先看这个工具有没有这个东西,再决定要不要用它——这比背原理有用得多。
🔧 动手做:找出图里你没要求的东西(5 分钟)
不需要出图,只需要一双眼睛。
- 回到上面那张水彩车站图,把它放大,列出至少五样提示词里没提、但图里有的东西。(提示:牌子、长椅、信号灯、铁轨条数、房子的颜色、天气的具体程度……)
- 在每一样后面写一句:如果我在意这个,我该在提示词里写什么? 比如"牌子" → "站牌上写着'青山站'三个字"。
- 最后回答一个问题:这五样里,有几样是你真的在意的?
你会看到:大部分你都不在意。这正是关键——提示词不需要写满,只需要写你在意的那几件。语料里 229 条提示词平均只写了 3.8 件事,中位数是 4 件,不是十件二十件。
为什么:新手最容易走的弯路是"写得越全越好",结果条件互相打架,图反而更失控。先学会分清"我在意的"和"随它去的",比学会写长提示词重要得多。
三句话收束这一节:
- 提示词是条件不是命令——你写的每句话都在缩小"什么样的图算合格"的范围,没写的部分由模型按"通常长什么样"补齐。
- 那块拼不成词的站牌就是证据:模型补全的是"像不像",不是"对不对"。
- 扩散模型那套原理对 SD / FLUX 成立,但本课语料所用模型的内部机制官方没公开,本课不猜;本节结论来自可观察行为,不依赖机制。
下一节把"路线差异"讲清楚:市面上的工具其实分三条路,选错路线比选错工具的代价大得多。
🔎 来源与核验· 5 条,点开核对

