动作镜三段式:告诉模型为什么
学完你写动作时会多写一段"为什么",而这一段决定了动作自不自然
动作是这门手艺里最容易崩的东西。
你写"他推开门走进去",抽出来的可能是:手穿过门板、腿在原地滑行、 或者一个僵硬得像提线木偶的走路姿势。
大多数人的应对是把动作写得更详细 —— 加上"右手握住门把手,顺时针转动 90 度"。 这通常没用,有时候更糟。
原作者对此有一条心法,他自己称之为最强的一条。它要求你在提示词里 多写一样绝大多数人不会写的东西:为什么。
教一个新来的服务员端盘子。
指令式:"左手托底,右手扶边,手臂夹紧,小步走。" 他会照做,而且看起来非常别扭 —— 因为他在执行动作,不是在端盘子。
说明式:"这盘汤很满,晃出来会烫到手,所以你走的时候得盯着汤面。" 他自己就找到了那个姿势,而且看起来很自然。
第二种说法里多了一样东西:后果。而正是后果让动作变得合理。
三段式
写动作镜时,把它拆成三段:
① 要怎么做 —— 动作本身,按发生顺序
② 为什么 —— 这个动作背后的动机 / 处境
③ 想要的效果 —— 这一镜看完观众应该有什么感觉
原作者的范例(一只鸵鸟踩到报纸):
要怎么做:脚掌猛踩报纸 → 报纸沾脚带走 → 另一只脚抬起试图甩开 为什么:因为报纸粘住很不舒服 想要的效果:所以变成单脚跳跃前进,整体幽默滑稽
看第三段那个"所以" —— 它不是在描述一个新动作, 它是前两段的自然结果。 你没有告诉模型"单脚跳", 你告诉它"粘住了、很不舒服",单脚跳是它自己算出来的。
这条片子的范例:镜 1 收势
补进本片之后,镜 1 最后那一拍是这么写的:
要怎么做:僵尸倒地,机器人没有收势耍帅,而是急忙掀开保温箱盖、 低头检查那碗红烧肉。 为什么:因为它在乎的从来不是打赢,而是这碗肉有没有洒、有没有凉。 效果:反差萌 + 笑点,瞬间从"功夫高手"切回"怕被扣差评的打工人"。
⚠️ 注意"要怎么做"那段里有一个否定:"没有收势耍帅"。
这很重要 —— 模型的默认行为是"打完架要摆个姿势",那是它见过最多的画面。 你不主动排除掉那个默认,它就会给你一个耍帅的收势。
为什么"为什么"有用
原作者给这条心法的说法是:
不要把 AI 当冰冷工具,当创作伙伴;不要命令它,要指引它。
这句话很像鸡汤,但它背后有一个很实的机制 ——⚠️ 下面这段是我的解读,不是留档原文:
动作的自然感来自"每一帧都被同一个动机约束"。
你只写动作序列,模型就是在逐帧拼接你列的那几个姿势, 帧与帧之间没有内在的联系,于是就"僵硬"。
你给了动机,模型就有了一个贯穿所有帧的约束 —— "她在躲一个很烫的东西"会同时影响手的角度、身体的重心、脸的方向, 而这些是你列不完的。
🔴 换句话说:"为什么"不是修辞,它是在用一句话替代一百条细节。
武打戏还有一层:先让 AI 写初稿
留档里另有一条,专门针对最难的那类动作 —— 打斗:
他自认"写文戏行、写武戏不行",所以武打段先让 AI 按模板生成动作分镜 —— 给它地点、主角如何入画、用什么武器、几名敌人、攻击方式、收尾、氛围词、战斗节奏, AI 给一版 → 改详细 → 加限制 → 反复改到贴合。
关键在最后一句:
拿到 AI 的提示词后仍要自己改。
留档举了他的例子:AI 给了 7 个分镜,他要 8 个 —— 还自己补了开头 "机器人面部重摔地面"和收尾。
AI 写的是一个合格的骨架,不是你的那条片子。
两条真的:同一个连招的头两拆
上面讲的都是方法。下面是这条片子实际用出去的两条提示词 —— 镜 1 那套功夫被拆成四招,这是头两招。注意每一条都完整带着三段式, 而且第 1a 条里那个「为什么」只有一句话:它一点不慌,是在护住车上那盒红烧肉。
@机器人资料卡 同一台复古原子朋克外卖机器人:潜水盔圆头、单只暖琥珀色发光镜眼(非人脸,情绪只压暗不变色)、黄铜与哑光钢躯体、机械手脚、略佝偻打工人;漆面剥落露金属、关节渗油积灰;褪色暖黄外卖冲锋衣+帆布围裙、背保温外卖箱。废土霓虹街,破败招牌频闪、湿地映霓虹、热风卷尘。变形宽银幕电影质感,Sony Venice+Canon K-35,35mm 胶片颗粒,低饱和高对比,16:9,shallow DOF;超写实、极致逼真、真人实景拍摄;杜绝游戏CG感、杜绝动作僵硬。侧面中景,不框死构图。手持拍摄,全程保持极其轻微、如呼吸般的镜头浮动。 要怎么做:一只风格化非血腥僵尸侧扑过来,机器人拇指快速抹一下镜眼下沿、单手向僵尸招手挑衅,外卖服衣摆轻扬;@狗资料卡 那只穿衣服的德牧吓得缩在三轮车后、爪子捂眼偷看。 为什么这么做:机器人一点不慌,是在邀战、护住车上那盒红烧肉;狗则纯怂。 想要的效果:机器人痞帅 vs 怂狗的双重反差萌,琥珀镜眼亮一下,氛围幽默荒诞。 声音:仅同期声——机械伺服轻响、热风、僵尸低吼、狗的呜咽;不要任何背景音乐、不要旁白人声。画面内不出现任何文字、logo、水印。
@机器人资料卡 同一台外卖机器人(潜水盔头、暖琥珀镜眼、暖黄外卖服+围裙、背保温箱),废土霓虹街。变形宽银幕电影质感,Sony Venice+Canon K-35,35mm 胶片颗粒,16:9,shallow DOF;超写实、极致逼真、真人实景拍摄;杜绝游戏CG感、杜绝动作僵硬。中景偏低角,跟随僵尸扑势短促横移。手持拍摄,全程保持极其轻微、如呼吸般的镜头浮动。 要怎么做:一只僵尸扑到面前,机器人一记干净利落的侧掌寸劲推在它胸口、把它稳稳定住,另一只手端着那盒红烧肉纹丝不动。 为什么这么做:发力只为卸掉冲势、绝不让那盒肉洒出来。 想要的效果:举重若轻、毫不费力,盒里红烧肉一滴汤不洒,顶级功夫只为护一份外卖的荒诞反差。 声音:仅同期声——一声闷响、机械伺服、一声短促气音"哈";不要背景音乐、不要旁白。画面内不出现任何文字、logo、水印。
⚠️ 两条对照着看,你会发现除了动作那三段,其余部分一字不差 —— 那就是 s2.5 讲的锁定块在起作用。
而本节开头引用的那段三段式(护肉收势),完整的一条长这样 —— 注意狗那半句也在里面:
@机器人资料卡 同一台外卖机器人 + @狗资料卡 穿衣服的德牧,废土霓虹街,僵尸已倒地。变形宽银幕电影质感,Sony Venice+Canon K-35,35mm 胶片颗粒,16:9,shallow DOF;超写实、极致逼真、真人实景拍摄;杜绝游戏CG感、杜绝动作僵硬。中景转半身,缓缓推近到保温箱那盒肉。手持拍摄,全程保持极其轻微、如呼吸般的镜头浮动。 要怎么做:僵尸全部倒地,机器人没有摆造型耍帅,而是急忙转身掀开保温箱盖、低头凑近检查那碗红烧肉;狗这才从车后冲出来,对着倒地僵尸汪汪壮胆、邀功。 为什么这么做:机器人在乎的从来不是打赢,只是这碗肉有没有洒、有没有凉;狗是打完了才来逞英雄。 想要的效果:机器人确认无事、肩膀一松、缓缓直起腰恢复佝偻打工人,配怂狗逞强,反差萌收束。无台词、无爆炸、无强光。 声音:仅同期声——箱盖轻响、细微热气声、如释重负的伺服泄气音、狗事后逞强的吠叫;不要背景音乐、不要旁白。画面内不出现任何文字、logo、水印。
🔧 动手做:把一个动作镜改写成三段式(8 分钟)
- 挑你分镜里最难的那个动作镜。
- 原样抄下你现在的写法,放在旁边对照。
- 写第一段(要怎么做):把动作按发生顺序拆成 2-3 步,用箭头连起来。 🔴 并且写一个否定 —— 这个动作最"套路"的做法是什么?明确排除掉它。 (打完架不许摆姿势 / 哭的时候不许捂脸 / 开门后不许愣在门口)
- 写第二段(为什么):一句话,说人物的处境或动机,不说动作。 ⚠️ 检查:这句话里不应该出现任何身体部位。 出现了,说明你还在写动作。
- 写第三段(效果):观众看完这一镜应该产生什么感觉。 用"所以……"开头,逼自己让它成为前两段的结果。
- 两条各跑一次,对比。
你会看到:第 4 步最难。你会反复想写"她的手在抖" —— 那是效果不是原因。原因是"她刚知道那个消息"。
为什么:你能列出来的身体细节永远是有限的,而模型需要的是一个能推导出无限细节的约束。 动机就是那个约束。这也是为什么三段式里最短的那一段最值钱。
最常见的走样是这样:
要怎么做:她哭了。 为什么:因为她很伤心。 效果:让观众觉得很伤心。
三段都在说同一件事,等于一段都没写。
三段各有分工,它们之间必须不能互相推导:
- "为什么"如果只是把动作换个说法(哭 → 伤心),它没有提供新信息。
- 有用的"为什么"应该能让模型推出你没写的动作 —— "周围站满了不能让她哭的人"能推出:憋着、别过脸、指甲掐掌心。
自检:遮住第一段,只看第二段,你能不能猜出这个人在做什么? 猜得出,说明这个"为什么"是有信息量的。
三句话:
- 动作镜写三段:要怎么做 / 为什么 / 想要的效果 —— 最短的"为什么"最值钱,它用一句话替代一百条细节。
- 第一段里要写一个否定,主动排除掉这个动作最套路的做法 (这条片子写的是"没有收势耍帅")。
- 最难的打斗段可以先让 AI 写初稿再自己改 —— 但"拿到 AI 的提示词后仍要自己改"是原话,AI 给的是骨架不是你的片子。
三个杀手锏还剩最后一个,而原作者点名说它是最容易被忽略的一点。 它不在画面上,在声音上 —— 不写它,你的后期会付出重抽的代价。
🔎 来源与核验· 4 条,点开核对
