← 返回目录
h0.2概念⏱ 约 9 分钟

AI 出图到底在做什么:它不是在执行命令

学完你会用"条件"而不是"命令"来理解提示词,并看懂图里那些你没要求的东西

🔎 最后验证 2026-08📚 来源:Gemini 图像生成官方文档;通义万相官方 API 文档;本课语料中的配对样本
为什么学这个

很多人第一次用 AI 出图,心里想的是"我下了一道命令,它去执行"。这个理解会让你在头一百张图里持续挫败:你说了不要的东西它偏画,你没说的东西它自作主张加上,同一句话跑两遍出来两个样。

这一节不讲扩散模型的数学,讲一个更管用的东西:把提示词理解成"条件"而不是"命令"。 换掉这一个词,后面十来个"为什么它不听话"会同时得到解释。

我们从一张图开始——而且是从这张图里没人要求过的那部分开始。

💡 打个比方

你去照相馆,跟摄影师说:"我要一张雨天车站的水彩画感觉的照片。"

摄影师不会问你"车站牌子上写什么字"。他会自己找一个像那么回事的车站,牌子上原本写什么就写什么——因为牌子上的字不在你的要求里,但一个车站不可能没有牌子

AI 出图是同一回事,只是更极端:它不但会补上牌子,还会补上看起来像字、但其实不是字的东西。因为在它见过的几亿张车站照片里,那个位置总有一块字形状的东西

从这张图里你没要求的那部分说起

漫画 / 故事板 - 雨中火车站水彩画
插画 / 绘画漫画 / 故事板 - 雨中火车站水彩画
47 个字的提示词,只说了两件事:水彩画、在雨中的火车站等待。现在看左上角那块站牌。
🎨 生成这张图的提示词
水彩画:{argument name="scene" default="在雨中的火车站等待"}
提示词里一个字都没提牌子,更没提牌子上写什么。但图里不但有牌子,牌子上还有“STATIONMD”“SNES NIRES”这样的字——它们不是任何语言里的词。模型不是在执行“画个车站”这道命令,它是在生成一张“看起来像雨天车站”的图,而“像车站”这件事本身就包含了“那个位置有一块带字的牌子”。
出图模型:Nano Banana / Gemini 图像生成作者:AI Art Alley来源:YouMind许可:CC BY 4.0

这块乱码牌子是理解 AI 出图最好的入口。它说明了三件事:

一、模型补全的是"像不像",不是"对不对"。 它见过的车站照片里,遮雨棚下方总有一块牌子,牌子上总有深色的字形。于是它给了你一块牌子和一片字形。至于那些字形拼起来是不是一个词——在"像不像一张车站照片"这个尺度上,不重要

二、你没说的部分,它一定会替你填。 一张图有几百万个像素,你的提示词只有几十到几百个字。中间巨大的空白由模型按"通常长什么样"补齐。这不是 bug,这是它必须做的事——否则它没法输出一张完整的图。

三、所以提示词是条件,不是命令。 你写的每一句话,都是在缩小"什么样的图算合格"的范围。你写得越具体,合格范围越窄,出来的图越接近你想的;你留白越多,模型自由发挥的地方越多。

换个词,十个问题一起解释

把"命令"换成"条件"之后,几个常见困惑当场变形:

你的困惑用"条件"重新理解
同一句话跑两遍不一样符合同一组条件的图有无数张,它每次给你其中一张
我说了"不要文字",还是有文字你加了一个条件,但"像海报"这个条件本身强烈要求有文字,两个条件在打架
我写"高级感"没用,写"哑光黑色金属"就有用前者不能缩小范围(什么图都能自称高级),后者能
我加了一堆形容词,图反而更乱条件之间互相冲突时,模型只能各让一步

这也是本课后面所有内容的地基:H1 教你把"想要的画面"拆成一组能缩小范围的条件,H2 教你在条件之间冲突时怎么办。

内部机制:两条路线,而且有一条官方没公开

到这里要停一下,说一句诚实的话。

市面上讲"AI 绘画原理"的内容,基本都在讲扩散模型:从一团随机噪点开始,一步步去掉噪声,最后显出一张图。这个描述对 Stable Diffusion、FLUX 这条路线是成立的,它们的做法有公开论文可查。

但本课语料用的 Nano Banana / Gemini 系列不属于那条路线,它是把图像生成长在大模型里的"原生多模态"做法。官方文档提到过图像编辑走的是"推理与生成结合的过程",也提到 Pro 档有思考模式——但它内部到底怎么生成像素,官方文档没有公开。第三方的说法互相矛盾,本课不猜

那这一节讲的东西还成立吗?成立,因为它不依赖机制。"提示词是条件不是命令"是从可观察的行为归纳出来的——你没要求的牌子出现了、你要求过的东西有时没出现、同一条提示词出两张不同的图。这些现象在两条路线上都成立。

⚠️ 避坑拿“扩散模型原理”去解释所有工具的行为

这是网上教程最常见的一类错误:用扩散模型的机制,去解释一个不是扩散模型的工具为什么这样那样。

一个具体的后果:"负面提示词"并不是通用概念。 通义万相的官方 API 有一个独立的 negative_prompt 字段,官方说明是"用来描述不希望在画面中看到的内容";而 Gemini 的图像生成没有这个字段,你只能在正向提示词里用语义否定("移除背景里的车")。

如果你信了"AI 绘画都要写负面提示词",到了没有这个字段的工具上,你会写出一堆不知道被怎么处理的话。先看这个工具有没有这个东西,再决定要不要用它——这比背原理有用得多。

🔧 动手做:找出图里你没要求的东西(5 分钟)

不需要出图,只需要一双眼睛。

  1. 回到上面那张水彩车站图,把它放大,列出至少五样提示词里没提、但图里有的东西。(提示:牌子、长椅、信号灯、铁轨条数、房子的颜色、天气的具体程度……)
  2. 在每一样后面写一句:如果我在意这个,我该在提示词里写什么? 比如"牌子" → "站牌上写着'青山站'三个字"。
  3. 最后回答一个问题:这五样里,有几样是你真的在意的?

你会看到:大部分你都不在意。这正是关键——提示词不需要写满,只需要写你在意的那几件。语料里 229 条提示词平均只写了 3.8 件事,中位数是 4 件,不是十件二十件。

为什么:新手最容易走的弯路是"写得越全越好",结果条件互相打架,图反而更失控。先学会分清"我在意的"和"随它去的",比学会写长提示词重要得多。

❓ 测验
提示词里完全没提文字,生成的车站图里却出现了拼不成词的字形。最贴切的解释是?
❓ 测验
关于本课语料所用的 Nano Banana / Gemini 图像模型的内部机制,本课的口径是?
✅ 小结

三句话收束这一节:

  1. 提示词是条件不是命令——你写的每句话都在缩小"什么样的图算合格"的范围,没写的部分由模型按"通常长什么样"补齐。
  2. 那块拼不成词的站牌就是证据:模型补全的是"像不像",不是"对不对"。
  3. 扩散模型那套原理对 SD / FLUX 成立,但本课语料所用模型的内部机制官方没公开,本课不猜;本节结论来自可观察行为,不依赖机制。

下一节把"路线差异"讲清楚:市面上的工具其实分三条路,选错路线比选错工具的代价大得多。

下一节 → 三条技术路线
🔎 来源与核验· 5 条,点开核对
本节每个关键论断都对应一个可追溯的来源 —— 这是本课程"靠谱、不过时"的底线。
「通义万相有独立的 negative_prompt 字段,官方说明为“用来描述不希望在画面中看到的内容”」
「Gemini 图像生成没有独立的负面提示词字段;官方将图像编辑描述为推理与生成结合的过程,Pro 档具备思考模式」
📚 Gemini API 图像生成官方文档✓ 已核验 2026-08
「Nano Banana / Gemini 图像模型的像素生成机制官方未公开,本课不做断言」
📚 本课证据边界声明(官方文档未见相关说明,第三方来源互相矛盾)✓ 已核验 2026-08
「47 字的水彩车站提示词未提及任何文字,成品图中出现拼不成词的站牌字形」
📚 本课语料中的配对样本(提示词与成品图同屏可核)✓ 已核验 2026-08
「229 条提示词平均写 3.8 件事、中位数 4 件」
📚 本课对语料的结构化统计✓ 已核验 2026-08
智图软件的赞赏码
都看到这了,打个赏呗!
接下来 · h0.3
三条技术路线:你租的是能力,还是拿到了模型
继续读下一节 →