现在的视频模型已经能生成一段像样的舞蹈了,但你直接写「一位古装女子在宫殿里起舞」, 拿到的东西通常有三个毛病:人一格一变脸、动作是物理上做不出来的、镜头自己乱飞。 多数人的反应是把提示词写得更长。
我在 X 上追了 @MrLarus 三个月的作品,发现他绕开了这件事。 他不写更长的提示词,而是在中间插了一张图—— 先用 GPT-Image-2 生成一张 4×4 的十六宫格编舞分镜图, 再把这张图当成剧本交给视频模型执行。这个中间产物,是整套方法的全部秘密。
文生视频模型接到「她在跳舞」的时候,其实接到的是一个空位。 舞是什么舞、几个动作、动作之间怎么过渡、镜头站在哪、裙子什么时候被甩起来—— 这些它全都得自己填。而它填空的方式是逐帧往下猜, 猜到第三秒的时候,它已经不太记得第一秒那个人长什么样了。
于是你会稳定地拿到三类失败。第一类是身份漂移: 同一段视频里脸在变、发型在变、腰封的花纹在变。 第二类是物理不可信:人在半空多停了半秒,或者做出一个真人关节做不到的旋转。 第三类是镜头失控:模型为了掩盖动作衔接不上,自己插了一堆快切和晃动。
这三类失败有一个共同的根:没人告诉它这段舞由哪些具体动作组成、按什么顺序发生。 长提示词能解决风格、能解决配色、能解决氛围,但它解决不了「动作节点」这件事—— 因为文字里塞不下十六个动作的空间关系,塞下了模型也读不成一条时间线。
这套打法只有两步,第一步的产物才是关键:
一张图,十六格,每格一个编号、一个四字动作标题、一句动作说明。 同一个人、同一套衣服、同一个空间,十六个连续动作节点。
视频模型不再自由发挥,它的任务从「编舞」降级成「执行」—— 按 1 到 16 的顺序把这张图演出来。
这个中间产物同时是三样东西,这才是它管用的原因:
它是编舞表。十六个动作被写死了,模型不用猜下一拍做什么。
它是角色设定表。同一张脸在十六格里出现了十六次——这是一次生成里的十六个视角,比十六次独立生成再去对齐容易得多。
它是镜头表。每一格的景别、机位高度、身体朝向都已经定死,视频模型只需要在格与格之间做运镜。
作者自己那句话说得比我清楚:重点不是生成一张好看的人像, 而是先把舞蹈拆成动作节点、服装动态、场景氛围、镜头感这四件事。 换句话说——他把「编舞」这个工种从视频模型手里拿走了,交给了生图模型。 生图模型擅长在一张画面里维持一致性,视频模型擅长在时间上做插值。 这一招做的事,就是让两个模型各干各擅长的那一半。
16 = 4×4,这是唯一能让「格数够多」和「每格还看得清全身」同时成立的排版。 八格编舞太粗,动作之间的跳跃太大;二十四格之后每格只剩一个模糊的小人影, 视频模型读不出手臂到底在哪个高度。4×4 是这套方法的物理上限,不是审美选择。
九套提示词的块结构几乎完全一致。把它们对齐之后能看出来, 这不是一份「描述」,而是一份防御清单——每个块都对应一种已经踩过的坑。
| 块 | 它写的是什么 | 它在防什么 |
|---|---|---|
| 整体定位 | 「这不是普通古风写真,也不是舞蹈教学图,而是一张分镜海报」 | 防模型把它当单张美人图来画——这是全篇最重要的一句 |
| 场景设定 | 具体空间 + 时刻 + 五到七个环境物件 + 前中后景要求 | 防「黑背景棚拍」这个默认解 |
| 人物设定 | 年龄段、气质词、以及那句一致性锁 | 防每格换人 |
| 服装与妆造 | 服制 + 配色(1 主 1 辅 1 点缀)+ 核心道具 + 织物必须有动态 | 防戏服感、防道具消失、防裙子像纸板 |
| 画面风格 | 写实/电影感 + 「所有动作必须真人可完成」 | 防玄幻化、防悬浮 |
| 版式要求 | 4×4、编号、中文小标题、轨迹箭头、分辨率 | 防排版糊掉、防格数漂移 |
| 动作分镜顺序 | 16 行,每行「四字标题 + 一句身体描述」 | 这是编舞本体 |
| 重点要求 | 把前面最关键的三到五条再说一遍 | 防长提示词的中段被稀释 |
值得单独拎出来的是第一块和最后一块。第一块永远以否定句开场—— 先说「这不是什么」,再说「这是什么」。这跟给模型一道栅栏是一个道理: 直接说「画分镜图」,模型的先验会把它拉向「一张漂亮的古风海报」; 先把那个先验挡掉,剩下的描述才落得进去。
最后一块是刻意的重复。一条提示词一千七百字,中段的要求在采样时权重会被稀释, 所以他把「同一舞者一致性」「织物动态」「每格动作必须不同」这几条在结尾又写了一遍。 这不是啰嗦,是给长提示词做的一次收尾加权。
如果这套方法只允许保留一句话,是这句:
九套提示词里,这句话以几乎逐字相同的形式出现了九次。 它之所以有效,不只是因为说得明确,更是因为它被放进了一次生成里—— 十六格是同一张图的十六个区域,模型在同一次前向过程里维持它们的一致性, 跟你分十六次生成再想办法对齐,是两个难度量级的问题。
披帛、水袖、红绸、银饰、头纱——每一套的服装块里都有一条同样结构的要求: 这些东西必须随动作产生真实动态,而且必须是身体上原生的那一件,不是外加的道具。 红绸剑舞那套写得最直白:红绸要与剑或手部形成动态联系; 水下洛神那套则反过来限制——丝带在水里不能像在空气里飞舞,要有阻力感和延迟感。
这条锁解决的是一个很具体的失败:模型很容易把飘带理解成一个独立的装饰元素, 于是第七格身上系着一条,第十一格凭空多出第二条。 把织物钉死在腰封上,它就从「画面元素」变成了「身体的延伸」—— 而这恰恰是中国古典舞里动势的主要载体。
同一时期另一位专做古风人像的作者,在他的开源风格库里给古风路由写死了一条约束: 「不夸张舞蹈化」。同一个模型、同一个题材,一个人在压制舞蹈动势, 另一个人在把它当主体来经营——这两条线的产物完全不同。
所以如果你要的是舞,用人像写真那套模板会一路被拉回站姿回眸。动势必须由你显式写进去。
这是我把九套动作表并排对齐之后最意外的发现。 九套舞的题材差得很远——盛唐宫廷、敦煌石窟、月夜竹林、西域石宫、水下、月宫、苗寨—— 但它们的节奏骨架是同一条。有三条命中率是 9/9。
永远是静态亮相。人立在空间中央,微侧身,一手垂落一手微抬。它不承担动作,它承担的是「建立这个人是谁、这是哪儿」。
低位(半蹲/半跪/俯身)永远落在格 6 或格 9,而且后面紧跟着一格「起身」——从不隔开。
永远是定格,不是动作。一臂高举一臂舒展,织物仍在轻轻流动。收尾从不留在运动中。
「低位→起身」这一对是整套编舞里最有信息量的一条。它在制造纵向落差: 前一格身体压到最低、织物铺在地上,下一格整个人拉起来、织物被向上带走。 对视频模型来说,这一对给了它一个方向明确、幅度足够大的插值区间—— 比两个都站着的姿势之间过渡要好做得多。
| 舞 | 低位格 → 起身格 | 高潮格 | 格 16 |
|---|---|---|---|
| 汉唐宫廷舞 | 9 → 10 | 12 盛唐大旋 | 霓裳定格 |
| 敦煌反弹琵琶舞 | 6 → 7 | 15 反弹琵琶大定格 | 壁画归位 |
| 红绸剑舞 | 7 → 8 | 15 红绸大旋 | 剑指苍穹定格 |
| 盛唐上元灯会宫廷舞 | 6 → 7 | 15 上元大旋 | 盛唐定格 |
| 西域胡旋舞 | 9 → 10 | 12 盛装大旋 | 西域定格 |
| 洛神水舞 | 6 → 7 | 15 神女大旋 | 洛神定格 |
| 苗族银饰舞 | 9 → 10 | 15 银铃大旋 | 苗岭定格 |
| 广寒宫月影舞 | 6 → 7 | 15 嫦娥升月 | 广寒定格 |
| 水下洛神舞 | 6 → 7 | 15 高光升腾 | 洛神收势 |
九套里七套把高潮放在格 15,紧挨着定格。 早期那两套放在格 12 的,后面还留了三到四格来收——他后来放弃了这个写法。 改成 15 的好处很直接:高潮和定格贴在一起,情绪不会在收尾段泄掉。 跃步/腾空则稳定落在 11–13 那一段,作为大旋之前的最后一次蓄力。
1 亮相 · 2 起势 · 3–5 展开与位移 · 6 或 9 低位 · 紧跟一格起身 · 中段一次半旋 · 11–13 跃步 · 15 大旋高潮 · 16 定格。
换题材的时候,需要改的只有每一格的身体描述和织物是什么, 这条曲线本身不用动。九套不同题材的舞证明它泛化得住。
九套提示词的负面约束高度重合,归起来是三类。有意思的是, 这三类分别对应模型的三个不同的默认倾向。
这是最高频的一条,九套全有。生图模型对「舞者」这个词的默认解就是舞台聚光灯下的黑背景, 因为训练数据里演出照占压倒性多数。不挡掉它,你写的宫苑、石窟、竹林都会被吞掉。
中文提示词里只要出现「古风」「披帛」「神女」,模型会顺手加发光粒子、把人托到半空。 他的对策是一句正面要求:所有动作必须是真人舞者真实可完成的。
这几条看起来像口水话,但它针对的是一个真实的失败模式: 夜景 + 暖光 + 十六格密集排版,很容易出现整体发灰、暗部堆死、格线附近出脏斑。 他把它当成一条独立的画质约束在写,而不是指望「高清」两个字。
每一套都点名了四到五个具体颜色(胭脂粉/象牙白/香槟金/淡石青这样), 而不是写「华丽配色」。颜色一旦被点名,十六格之间的色彩一致性会明显变好—— 这其实是一致性锁的一个分支。
第二段提示词的写法跟第一段完全不同。第一段是在描述一张图, 第二段是在下达一份执行命令。四条最关键的:
严格按画面 1 到画面 16 的顺序生成。这句话必须在最前面,而且要重复一次。
逐格指定镜头。不是笼统说「运镜优雅」,而是每一格配一个动作:缓慢推进/横向跟拍/半环绕/低机位慢推/随动作上抬。
指定一格做完整 360 度环绕,其余都不许。把最贵的运镜留给高潮格——他在汉唐那套里给的是画面 12。环绕一旦泛滥,一致性立刻崩。
一镜到底,不允许剪辑。连同「不要快切」「不要镜头乱晃」「不要出现字幕符号」一起写死。快切是模型掩盖衔接失败的手段,堵掉它,它就必须真的把动作连起来。
还有一条容易被忽略但很关键:人物与场景设定要在第二段里完整重写一遍, 不能假设「图里已经有了」。参考图管的是构图和身份, 但配色、材质、时刻、空间层次这些还是要用文字再钉一次。
同一位作者在做古典舞之前,先用这套骨架做过一版双人搏击分镜: 改成 16:9 横版、两个角色、明确要求「多镜头切换,不是固定机位」。 双人版的一致性锁写法也变了——给每个角色写死三个身份锚: 肤色、发型、以及一个不会混淆的颜色标记(红拳套 / 蓝拳套)。
这说明 16 宫格不是「舞蹈模板」,是一个通用的时间-空间压缩格式。 独舞用竖版,对抗和叙事用横版。
把九套按时间排开,能看到这个模板不是一次想清楚的,而是被产出磨出来的。 这条演化线本身比任何一套单独的提示词都有价值。
16:9 横版、两个角色、明确要求多镜头切换。块结构还很松,负面清单已经很长。
转成竖版独舞。整体定位 / 场景 / 人物 / 服装妆造 / 版式 / 动作分镜 / 重点要求——这七到八块从这里开始几乎没再变过。
在服装和版式之间插进一个新块,专门管「写实 vs 玄幻」这条线,以及「所有动作必须真人可完成」。
场景块和人物块被压成两三行,动作表和版式块原样保留。
【画面布局】从倒数第二块被提到了第二块——排版要求紧跟定位。动作块改名【16格动作内容】,每格的描述从一行变成一到两句,中间空行分隔。
汉代盘鼓舞、江南烟雨伞舞两条,正文直接写「提示词参考引用推」,不再给新的。
我得把这一节写得比前面都直白,因为这类方法最容易被读成万能钥匙。
它解决的是「让 AI 跳一段看得懂的舞」。身份一致、动作可信、镜头有逻辑——这三件事被这张中间图接管了。
它不解决「这段舞好不好看」。编舞质量完全等于你写的那十六行。写成十六个摆拍,出来就是十六个摆拍——他在每套里都亲自写了一句「不能只是摆pose」,就是因为这条太容易犯。
它对动作的物理真实性只做了下限保护。「真人可完成」挡掉的是悬浮和大腾空,挡不掉「这个动作在这个舞种里根本不存在」。舞种知识还是得你自己带进去。
十六格换算成时长是有隐含约束的。一段 30 秒的成片摊到十六格,每格不到两秒——对需要「大旋」这种要展开的动作来说太赶。短片应该减格数,而不是压节奏。
这篇是对公开材料的结构分析,不是复现报告。我逐条读了这九套提示词、 对齐了它们的块结构和动作表,也看了成片;但我自己还没有把这条流水线跑过一遍。
因此有三件事我没有数据:一次成功率是多少(作者没公开重试次数)、 十六格图到视频这一棒的一致性到底能保住多少、 以及换成别的视频模型是否还成立。这套方法的第二棒是跟具体视频模型绑定的, 换模型之后逐格镜头指令能被听懂多少,得实测。
我跑完会回来补一节,把成功率和翻车样本一起放上。在那之前, 上面所有关于「效果」的话都只到「结构上说得通」为止。
手上正好有一条要做的片子:三十秒、9:16 竖版、明代、一段剑舞—— 是舞不是打,这个区分很重要,因为它决定了动作表往「身韵」写还是往「招式」写。 九套里最接近的是红绸剑舞那套,但它的朝代、配色和空间都得换。
| 要动的 | 怎么动 |
|---|---|
| 格数 | 16 → 10 到 12。三十秒摊十六格每格不到两秒,大旋展不开。减格不减结构:亮相、低位→起身、大旋、定格这四个锚点全留。 |
| 服制 | 唐风大袖 → 明制。这一块要重写具体形制词,不能只写「古装」——形制词是模型唯一能抓住的锚。 |
| 道具与织物 | 剑保留,红绸这条要重新决定留不留。留就必须钉死「与剑或手部形成动态联系」,不留就得另找一件承担动势的织物。 |
| 空间 | 月夜竹林石台 → 换成与明代和这条片子叙事相符的空间,仍然按「五到七个物件 + 前中后景」来写。 |
| 动作表 | 逐行重写。这是唯一不能复制粘贴的一块,因为它就是编舞本身。 |
| 第二棒 | 换成我在用的视频工具。逐格镜头指令、一镜到底、单格 360 度这三条照搬,其余按工具的语法调。 |
真正让我决定写这篇的,不是这九套提示词本身,而是那三条 9/9 的结构。 一个人独立做了三个月,在七个完全不同的题材上收敛出同一条节奏曲线—— 这说明他找到的不是九个技巧,是一个格式。而格式是可以搬走的。
这套打法真正教的东西跟舞蹈没什么关系:当一个模型在某件事上不可靠时, 与其把指令写得更长,不如先造一个它能读懂的中间产物, 把那件难事挪到另一个更擅长的模型那里去做完。
十六宫格图就是这么一个中间产物——它把「时间」压成了「空间」, 于是一个不擅长记住时间的模型,就只需要读一张图。
这个思路能用的地方,远不止跳舞。