Gimbo's Universe / Ideas / 16 宫格编舞法
§ 生图 · 生视频 · 一个中间产物

别让 AI 跳舞,
先让它画分镜。

现在的视频模型已经能生成一段像样的舞蹈了,但你直接写「一位古装女子在宫殿里起舞」, 拿到的东西通常有三个毛病:人一格一变脸、动作是物理上做不出来的、镜头自己乱飞。 多数人的反应是把提示词写得更长。

我在 X 上追了 @MrLarus 三个月的作品,发现他绕开了这件事。 他不写更长的提示词,而是在中间插了一张图—— 先用 GPT-Image-2 生成一张 4×4 的十六宫格编舞分镜图, 再把这张图当成剧本交给视频模型执行。这个中间产物,是整套方法的全部秘密。

写于 2026.08.27 样本 同一作者 9 套中国古典舞提示词 时间跨度 2026.05.03 → 06.03 阅读约 14 分钟

「跳一段舞」不是一条指令

文生视频模型接到「她在跳舞」的时候,其实接到的是一个空位。 舞是什么舞、几个动作、动作之间怎么过渡、镜头站在哪、裙子什么时候被甩起来—— 这些它全都得自己填。而它填空的方式是逐帧往下猜, 猜到第三秒的时候,它已经不太记得第一秒那个人长什么样了。

于是你会稳定地拿到三类失败。第一类是身份漂移: 同一段视频里脸在变、发型在变、腰封的花纹在变。 第二类是物理不可信:人在半空多停了半秒,或者做出一个真人关节做不到的旋转。 第三类是镜头失控:模型为了掩盖动作衔接不上,自己插了一堆快切和晃动。

提示词写得再长,
也补不上一个没有编舞的舞。

这三类失败有一个共同的根:没人告诉它这段舞由哪些具体动作组成、按什么顺序发生。 长提示词能解决风格、能解决配色、能解决氛围,但它解决不了「动作节点」这件事—— 因为文字里塞不下十六个动作的空间关系,塞下了模型也读不成一条时间线。

把「时间」压成一张图

这套打法只有两步,第一步的产物才是关键:

1

用 GPT-Image-2 生成一张 4×4 十六宫格编舞分镜图

一张图,十六格,每格一个编号、一个四字动作标题、一句动作说明。 同一个人、同一套衣服、同一个空间,十六个连续动作节点。

2

把这张图 + 一段逐格视频提示词交给视频模型

视频模型不再自由发挥,它的任务从「编舞」降级成「执行」—— 按 1 到 16 的顺序把这张图演出来。

这个中间产物同时是三样东西,这才是它管用的原因:

它是编舞表。十六个动作被写死了,模型不用猜下一拍做什么。

它是角色设定表。同一张脸在十六格里出现了十六次——这是一次生成里的十六个视角,比十六次独立生成再去对齐容易得多。

它是镜头表。每一格的景别、机位高度、身体朝向都已经定死,视频模型只需要在格与格之间做运镜。

作者自己那句话说得比我清楚:重点不是生成一张好看的人像, 而是先把舞蹈拆成动作节点、服装动态、场景氛围、镜头感这四件事。 换句话说——他把「编舞」这个工种从视频模型手里拿走了,交给了生图模型。 生图模型擅长在一张画面里维持一致性,视频模型擅长在时间上做插值。 这一招做的事,就是让两个模型各干各擅长的那一半。

// 为什么是 16,不是 8 或 24

16 = 4×4,这是唯一能让「格数够多」和「每格还看得清全身」同时成立的排版。 八格编舞太粗,动作之间的跳跃太大;二十四格之后每格只剩一个模糊的小人影, 视频模型读不出手臂到底在哪个高度。4×4 是这套方法的物理上限,不是审美选择。

八个块,每一块都在防一种失败

九套提示词的块结构几乎完全一致。把它们对齐之后能看出来, 这不是一份「描述」,而是一份防御清单——每个块都对应一种已经踩过的坑。

块它写的是什么它在防什么
整体定位「这不是普通古风写真,也不是舞蹈教学图,而是一张分镜海报」防模型把它当单张美人图来画——这是全篇最重要的一句
场景设定具体空间 + 时刻 + 五到七个环境物件 + 前中后景要求防「黑背景棚拍」这个默认解
人物设定年龄段、气质词、以及那句一致性锁防每格换人
服装与妆造服制 + 配色(1 主 1 辅 1 点缀)+ 核心道具 + 织物必须有动态防戏服感、防道具消失、防裙子像纸板
画面风格写实/电影感 + 「所有动作必须真人可完成」防玄幻化、防悬浮
版式要求4×4、编号、中文小标题、轨迹箭头、分辨率防排版糊掉、防格数漂移
动作分镜顺序16 行,每行「四字标题 + 一句身体描述」这是编舞本体
重点要求把前面最关键的三到五条再说一遍防长提示词的中段被稀释

值得单独拎出来的是第一块和最后一块。第一块永远以否定句开场—— 先说「这不是什么」,再说「这是什么」。这跟给模型一道栅栏是一个道理: 直接说「画分镜图」,模型的先验会把它拉向「一张漂亮的古风海报」; 先把那个先验挡掉,剩下的描述才落得进去。

最后一块是刻意的重复。一条提示词一千七百字,中段的要求在采样时权重会被稀释, 所以他把「同一舞者一致性」「织物动态」「每格动作必须不同」这几条在结尾又写了一遍。 这不是啰嗦,是给长提示词做的一次收尾加权。

一致性锁:同一句话,九套里出现九次

如果这套方法只允许保留一句话,是这句:

「同一张脸、同一人物身份、
同一气质、同一套服装体系,
不要每格像换了一个人。」

九套提示词里,这句话以几乎逐字相同的形式出现了九次。 它之所以有效,不只是因为说得明确,更是因为它被放进了一次生成里—— 十六格是同一张图的十六个区域,模型在同一次前向过程里维持它们的一致性, 跟你分十六次生成再想办法对齐,是两个难度量级的问题。

第二把锁:织物必须长在身上

披帛、水袖、红绸、银饰、头纱——每一套的服装块里都有一条同样结构的要求: 这些东西必须随动作产生真实动态,而且必须是身体上原生的那一件,不是外加的道具。 红绸剑舞那套写得最直白:红绸要与剑或手部形成动态联系; 水下洛神那套则反过来限制——丝带在水里不能像在空气里飞舞,要有阻力感和延迟感。

这条锁解决的是一个很具体的失败:模型很容易把飘带理解成一个独立的装饰元素, 于是第七格身上系着一条,第十一格凭空多出第二条。 把织物钉死在腰封上,它就从「画面元素」变成了「身体的延伸」—— 而这恰恰是中国古典舞里动势的主要载体。

// 一个反向证据

同一时期另一位专做古风人像的作者,在他的开源风格库里给古风路由写死了一条约束: 「不夸张舞蹈化」。同一个模型、同一个题材,一个人在压制舞蹈动势, 另一个人在把它当主体来经营——这两条线的产物完全不同。

所以如果你要的是舞,用人像写真那套模板会一路被拉回站姿回眸。动势必须由你显式写进去。

九套舞,共用同一条节奏曲线

这是我把九套动作表并排对齐之后最意外的发现。 九套舞的题材差得很远——盛唐宫廷、敦煌石窟、月夜竹林、西域石宫、水下、月宫、苗寨—— 但它们的节奏骨架是同一条。有三条命中率是 9/9。

9/9
// 格 1

永远是静态亮相。人立在空间中央,微侧身,一手垂落一手微抬。它不承担动作,它承担的是「建立这个人是谁、这是哪儿」。

9/9
// 低位格 → 起身格

低位(半蹲/半跪/俯身)永远落在格 6 或格 9,而且后面紧跟着一格「起身」——从不隔开。

9/9
// 格 16

永远是定格,不是动作。一臂高举一臂舒展,织物仍在轻轻流动。收尾从不留在运动中。

「低位→起身」这一对是整套编舞里最有信息量的一条。它在制造纵向落差: 前一格身体压到最低、织物铺在地上,下一格整个人拉起来、织物被向上带走。 对视频模型来说,这一对给了它一个方向明确、幅度足够大的插值区间—— 比两个都站着的姿势之间过渡要好做得多。

高潮格的位置也在收敛

舞低位格 → 起身格高潮格格 16
汉唐宫廷舞9 → 1012 盛唐大旋霓裳定格
敦煌反弹琵琶舞6 → 715 反弹琵琶大定格壁画归位
红绸剑舞7 → 815 红绸大旋剑指苍穹定格
盛唐上元灯会宫廷舞6 → 715 上元大旋盛唐定格
西域胡旋舞9 → 1012 盛装大旋西域定格
洛神水舞6 → 715 神女大旋洛神定格
苗族银饰舞9 → 1015 银铃大旋苗岭定格
广寒宫月影舞6 → 715 嫦娥升月广寒定格
水下洛神舞6 → 715 高光升腾洛神收势

九套里七套把高潮放在格 15,紧挨着定格。 早期那两套放在格 12 的,后面还留了三到四格来收——他后来放弃了这个写法。 改成 15 的好处很直接:高潮和定格贴在一起,情绪不会在收尾段泄掉。 跃步/腾空则稳定落在 11–13 那一段,作为大旋之前的最后一次蓄力。

// 所以这条曲线可以直接抄

1 亮相 · 2 起势 · 3–5 展开与位移 · 6 或 9 低位 · 紧跟一格起身 · 中段一次半旋 · 11–13 跃步 · 15 大旋高潮 · 16 定格。

换题材的时候,需要改的只有每一格的身体描述和织物是什么, 这条曲线本身不用动。九套不同题材的舞证明它泛化得住。

他每次都写死的那些「不要」

九套提示词的负面约束高度重合,归起来是三类。有意思的是, 这三类分别对应模型的三个不同的默认倾向。

// 类型 1

反舞台

不要舞台 · 不要空黑背景 · 不要现代摄影棚

这是最高频的一条,九套全有。生图模型对「舞者」这个词的默认解就是舞台聚光灯下的黑背景, 因为训练数据里演出照占压倒性多数。不挡掉它,你写的宫苑、石窟、竹林都会被吞掉。

替代方案必须同时给:光挡不够,要立刻补上一个具体空间和它的五到七个物件。
// 类型 2

反玄幻

不要仙侠特效 · 不要悬浮 · 不要魔法光效 · 不要不合理大腾空

中文提示词里只要出现「古风」「披帛」「神女」,模型会顺手加发光粒子、把人托到半空。 他的对策是一句正面要求:所有动作必须是真人舞者真实可完成的。

唯一的例外是水下那套——那里反而要求「有阻力感和延迟感」,因为水下的物理本来就不同。
// 类型 3

反脏画面

不要乌漆麻黑 · 不要浑浊 · 不要色斑 · 不要糊 · 不要脏

这几条看起来像口水话,但它针对的是一个真实的失败模式: 夜景 + 暖光 + 十六格密集排版,很容易出现整体发灰、暗部堆死、格线附近出脏斑。 他把它当成一条独立的画质约束在写,而不是指望「高清」两个字。

配套:版式块里另外单独要求「分辨率要非常高清,人物和背景都清晰」。
// 加分项

配色纪律

1 个主色 + 1 个辅色 + 1 个金属或珠宝点缀色

每一套都点名了四到五个具体颜色(胭脂粉/象牙白/香槟金/淡石青这样), 而不是写「华丽配色」。颜色一旦被点名,十六格之间的色彩一致性会明显变好—— 这其实是一致性锁的一个分支。

并且都带一句:华丽但不俗艳/贵气但不杂乱。

交给视频模型时,要把它降级成执行者

第二段提示词的写法跟第一段完全不同。第一段是在描述一张图, 第二段是在下达一份执行命令。四条最关键的:

严格按画面 1 到画面 16 的顺序生成。这句话必须在最前面,而且要重复一次。

逐格指定镜头。不是笼统说「运镜优雅」,而是每一格配一个动作:缓慢推进/横向跟拍/半环绕/低机位慢推/随动作上抬。

指定一格做完整 360 度环绕,其余都不许。把最贵的运镜留给高潮格——他在汉唐那套里给的是画面 12。环绕一旦泛滥,一致性立刻崩。

一镜到底,不允许剪辑。连同「不要快切」「不要镜头乱晃」「不要出现字幕符号」一起写死。快切是模型掩盖衔接失败的手段,堵掉它,它就必须真的把动作连起来。

还有一条容易被忽略但很关键:人物与场景设定要在第二段里完整重写一遍, 不能假设「图里已经有了」。参考图管的是构图和身份, 但配色、材质、时刻、空间层次这些还是要用文字再钉一次。

// 一个横版变体,证明骨架不只服务独舞

同一位作者在做古典舞之前,先用这套骨架做过一版双人搏击分镜: 改成 16:9 横版、两个角色、明确要求「多镜头切换,不是固定机位」。 双人版的一致性锁写法也变了——给每个角色写死三个身份锚: 肤色、发型、以及一个不会混淆的颜色标记(红拳套 / 蓝拳套)。

这说明 16 宫格不是「舞蹈模板」,是一个通用的时间-空间压缩格式。 独舞用竖版,对抗和叙事用横版。

一个月里,模板自己变了三次

把九套按时间排开,能看到这个模板不是一次想清楚的,而是被产出磨出来的。 这条演化线本身比任何一套单独的提示词都有价值。

05.03横版原型

双人搏击版:4×4 分镜故事板

16:9 横版、两个角色、明确要求多镜头切换。块结构还很松,负面清单已经很长。

这一版确立了核心动作:把时间切成十六个可编号的瞬间。
05.04竖版定型

汉唐宫廷舞:八块结构成型

转成竖版独舞。整体定位 / 场景 / 人物 / 服装妆造 / 版式 / 动作分镜 / 重点要求——这七到八块从这里开始几乎没再变过。

动作表也在这里定型:四字标题 + 一句身体描述,十六行。
05.08加了一块

洛神水舞 / 苗族银饰舞:多出【画面风格】

在服装和版式之间插进一个新块,专门管「写实 vs 玄幻」这条线,以及「所有动作必须真人可完成」。

为什么加:前几套的玄幻化倾向大概是在这里被踩到的——它被从负面清单提拔成了一个独立的正面块。
05.11压缩

盛唐上元灯会:他自己标了「简版」

场景块和人物块被压成两三行,动作表和版式块原样保留。

信号很清楚:他发现吃重的是动作表和版式,环境描述可以省。
05.27重排

水下洛神 / 广寒宫月影:新版块序

【画面布局】从倒数第二块被提到了第二块——排版要求紧跟定位。动作块改名【16格动作内容】,每格的描述从一行变成一到两句,中间空行分隔。

两个方向同时发生:结构约束往前提,动作描述变厚。这是长提示词的常见收敛形态。
05 下旬起复用

后面的作品开始直接指回旧提示词

汉代盘鼓舞、江南烟雨伞舞两条,正文直接写「提示词参考引用推」,不再给新的。

这既是好消息也是坏消息:模板泛化得住,换主题就行;但也说明后期作品的新鲜度来自换题材,不再来自改方法。

它解决什么,不解决什么

我得把这一节写得比前面都直白,因为这类方法最容易被读成万能钥匙。

它解决的是「让 AI 跳一段看得懂的舞」。身份一致、动作可信、镜头有逻辑——这三件事被这张中间图接管了。

它不解决「这段舞好不好看」。编舞质量完全等于你写的那十六行。写成十六个摆拍,出来就是十六个摆拍——他在每套里都亲自写了一句「不能只是摆pose」,就是因为这条太容易犯。

它对动作的物理真实性只做了下限保护。「真人可完成」挡掉的是悬浮和大腾空,挡不掉「这个动作在这个舞种里根本不存在」。舞种知识还是得你自己带进去。

十六格换算成时长是有隐含约束的。一段 30 秒的成片摊到十六格,每格不到两秒——对需要「大旋」这种要展开的动作来说太赶。短片应该减格数,而不是压节奏。

// 我还没验证的部分

这篇是对公开材料的结构分析,不是复现报告。我逐条读了这九套提示词、 对齐了它们的块结构和动作表,也看了成片;但我自己还没有把这条流水线跑过一遍。

因此有三件事我没有数据:一次成功率是多少(作者没公开重试次数)、 十六格图到视频这一棒的一致性到底能保住多少、 以及换成别的视频模型是否还成立。这套方法的第二棒是跟具体视频模型绑定的, 换模型之后逐格镜头指令能被听懂多少,得实测。

我跑完会回来补一节,把成功率和翻车样本一起放上。在那之前, 上面所有关于「效果」的话都只到「结构上说得通」为止。

我接下来要拿它做什么

手上正好有一条要做的片子:三十秒、9:16 竖版、明代、一段剑舞—— 是舞不是打,这个区分很重要,因为它决定了动作表往「身韵」写还是往「招式」写。 九套里最接近的是红绸剑舞那套,但它的朝代、配色和空间都得换。

要动的怎么动
格数16 → 10 到 12。三十秒摊十六格每格不到两秒,大旋展不开。减格不减结构:亮相、低位→起身、大旋、定格这四个锚点全留。
服制唐风大袖 → 明制。这一块要重写具体形制词,不能只写「古装」——形制词是模型唯一能抓住的锚。
道具与织物剑保留,红绸这条要重新决定留不留。留就必须钉死「与剑或手部形成动态联系」,不留就得另找一件承担动势的织物。
空间月夜竹林石台 → 换成与明代和这条片子叙事相符的空间,仍然按「五到七个物件 + 前中后景」来写。
动作表逐行重写。这是唯一不能复制粘贴的一块,因为它就是编舞本身。
第二棒换成我在用的视频工具。逐格镜头指令、一镜到底、单格 360 度这三条照搬,其余按工具的语法调。

真正让我决定写这篇的,不是这九套提示词本身,而是那三条 9/9 的结构。 一个人独立做了三个月,在七个完全不同的题材上收敛出同一条节奏曲线—— 这说明他找到的不是九个技巧,是一个格式。而格式是可以搬走的。

先造一个中间产物,
再让模型去执行它。

这套打法真正教的东西跟舞蹈没什么关系:当一个模型在某件事上不可靠时, 与其把指令写得更长,不如先造一个它能读懂的中间产物, 把那件难事挪到另一个更擅长的模型那里去做完。

十六宫格图就是这么一个中间产物——它把「时间」压成了「空间」, 于是一个不擅长记住时间的模型,就只需要读一张图。

这个思路能用的地方,远不止跳舞。

关于这篇 · 写于 2026 年 8 月 27 日。 材料来自 Larus Canus(@MrLarus)在 2026 年 5 月 3 日至 6 月 3 日之间公开发布的一组作品与提示词, 方法与提示词著作权归其本人所有。
  • ① 本文是结构分析与方法转述,用我自己的话归纳其骨架、节奏与约束逻辑,未整段复制原作者的提示词;文中带引号的短句为必要引用,均不超过一句。想要完整提示词的人请去他的原帖取,每条都公开挂在正文或评论区;
  • ② 第 5 节的三条 9/9 结论,样本为该作者九套中国古典舞的十六格动作表(汉唐宫廷舞、敦煌反弹琵琶舞、红绸剑舞、盛唐上元灯会宫廷舞、西域胡旋舞、洛神水舞、苗族银饰舞、广寒宫月影舞、水下洛神舞),逐格人工对齐后统计;
  • ③ 第 4 节的「反向证据」出自另一位作者李岳(@liyue_ai)开源的古风人像风格库 female-portrait-director,其古风路由中写死了「不夸张舞蹈化」一条;
  • ④ 本文未复现该流水线,第 9 节已声明尚无成功率与翻车样本数据。跑通后会回来补。