本文作者:波妞PONYO(@ponyodong)。版权归作者所有,未经授权禁止转载。
Seedance 2.5 真正改变的,不是时长,而是创作者开始承担导演的责任。
这是一篇技术分析帖,觉得看了头晕的,可以直接复制粘贴下面的提示词骨架。只要照着这个骨架来写提示词,你的视频质量会有大大的飞跃
下面开始进入教程的正文:

有一句提示词,看起来什么都有:
一个女孩在雨中奔跑,电影感,紧张,手持摄影,超写实,8K。
拿去生成5秒到8秒,也许真能得到一段漂亮画面。
但当它要撑满30秒,麻烦立刻出现。
女孩为什么跑?她在逃,还是在找人?第8秒发生什么?第18秒为什么还值得继续看?最后三秒是给答案,还是留下一个更大的问题?
原来的提示词一句也没说。
很多人第一次写30秒提示词,会把5秒提示词写长六倍。多加一点环境,多堆几个镜头,再补一串“电影感、史诗感、高级感”。
字更多了,控制反而更少。
因为他仍然在描述一张画面,却期待模型交出一段戏。

30秒不是长度升级,是职责升级
5秒里,模型可以靠主体、氛围和一个动作完成任务。
30秒里,它必须同时处理人物目标、动作顺序、空间方向、镜头节奏、声音、对白和结尾。
你不决定的部分,模型就会替你决定。
而模型临时替你做出的决定,往往正是换脸、跳空间、动作错序和剧情失控的来源。
所以30秒提示词不是一篇形容画面有多美的作文。
它更像一份微型导演通告。
30秒提示词 = 输出规格 + 参考素材分工 + 一句话故事 + 连续性锁定 + 分秒时间轴 + 摄影与表演 + 声音与对白 + 禁止事项

这八项不一定每次都要写得很长。
但你至少要做出决定。
写镜头之前,先把故事压成一句话
真正应该先写的,不是“00—03秒大雨,03—06秒特写”。
而是:
谁,为了什么采取行动,却发现什么异常,最后面对什么结果。
例如:
一名女救援员进入废弃地铁寻找失踪的弟弟,却发现弟弟的声音正从她捡到的书包里传出来。
这句话已经包含了主角、目标、地点、异常和结果方向。
如果一句话里挤进三名主角、两个地点、四个目标和三次反转,30秒大概率装不下。
一个稳妥的起点是:一个主要人物、一个主要地点、一个清晰目标、一件核心道具、一次主要反转、一到三句短对白。
做减法不是因为模型弱。
是因为观众也需要时间看懂。
30秒最怕的不是慢,而是没有变化
有些视频剪得很快,看完却什么也没发生。
有些镜头很慢,你却不敢移开眼睛。
区别不在剪辑速度,而在观众是否不断获得新信息。
30秒里,每一段至少要完成一件事:
让观众比上一秒多知道一点,或者让他原来相信的东西失效。

00—03秒:钩子
不要急着交代世界观。先给一个异常、欲望、问题或危险。
可以是一只本不该震动的书包,也可以是一句不该出现的声音。第三秒以前,观众最好已经在问:发生了什么?
03—08秒:建立
让观众迅速看懂:谁、在哪里、想做什么。
这不是背景介绍大会,只给理解下一步行动所必需的信息。
08—16秒:行动
主角必须做出具体动作,而且动作要带来新信息。
“她走过去”不是戏。
“她走过去,发现书包内部正在起伏”才是。
16—24秒:升级
让障碍靠近,让原来的办法失效,或者让一次误判被打破。
观众要意识到:事情比刚才以为的更糟,或者更复杂。
24—30秒:回报或尾钩
最后不是单纯停机。
它应该给出结果、逼人物做选择、改变观众理解,或者留下一个更具体的新问题。
好尾钩不是突然蹦出一只怪物。
它是前面所有信息共同推开的一扇门。
每个时间段,只写四件事
人物动作 + 新信息 + 摄影机反应 + 声音变化
弱写法:
10—15秒:她很害怕。
“害怕”是结论,不是可以被拍到的动作。
更有效的写法是:
10—15秒:她蹲下捡起书包,发现书包仍在轻微震动。摄影机从中景缓慢推到她握住拉链的手部近景。远处金属摩擦声突然停止,只剩她压低的呼吸。
这里没有写“非常恐怖”。
但手停住、声音消失、镜头靠近,恐怖已经发生了。
一个时间段也只安排一个主事件。五秒里塞进开门、下楼、找人、怪物出现和建筑爆炸,模型只能随机挑几件做。
动作越清楚,结果越有力。
参考素材不是附件,是控制器
支持上传大量参考素材,最容易诱发的错误,就是把素材库一股脑扔进去。
一张图是短发,另一张图是长发;一个场景出口在左边,另一个出口在右边;一段视频想控制动作,却又带来一张不同的脸。
模型不是没看见。
它是看见了太多互相打架的决定。

一个更稳的起步配置,是3—8个各司其职的素材:
- 人物身份图:锁定五官、发型和年龄感;
- 服装全身图:锁定服装、体型和装备;
- 场景图:锁定空间结构、方向和主光;
- 核心道具图:锁定颜色、尺寸和磨损;
- 动作参考视频:只控制路径、速度和节奏;
- 音色参考:只控制音色与年龄感;
- 风格参考:只控制色彩、颗粒和质感。
每份素材都回答两句话:
参考什么?
不参考什么?
“@图片1只参考女主的面部和发型,不参考背景”,比“参考图片1”强得多。
连续性锁,决定这条视频能不能用
镜头可以变化,事实不能随便变化。
人物的脸、服装、道具、空间、光线和风格,都应该有明确的锁定对象。
一段可以直接使用的写法是:
全片始终为同一名女救援员、同一套深蓝色救援服、同一只红色旧书包和同一座地铁站。站台出口始终位于画面深处左侧。冷白应急灯是唯一主光源。人物面部、发型、服装、道具比例、移动方向和空间结构在所有镜头中保持一致。
这段话不漂亮,却很值钱。
因为它把模型最容易自由发挥的地方,提前收了回来。

镜头不是越专业越好
航拍、环绕、推拉摇移、希区柯克变焦、子弹时间、手持、长焦、鱼眼——词都认识,堆在一起却不等于导演。
镜头只需要回答一个问题:
观众现在最应该看什么?
大全景负责交代人与环境;中景看动作和关系;近景看反应与决定;特写强调线索;主观镜头让观众和角色看到同一件事。
缓慢推进意味着真相靠近;手持跟随制造身体感;横移用来显露被遮挡的信息;固定机位让异常在画面内部发生。
如果换掉一个镜头运动,剧情理解毫无变化,它大概率只是装饰。
声音不能等画面做完再补
在30秒里,声音完全可以承担一次反转。
灯熄灭后,环境声突然被抽空;原本来自隧道深处的声音,下一次却从人物手中的对讲机响起;音乐停止,有时比音乐变响更让人紧张。
声音可以分成三层:
- 环境层:风、水滴、电流、空房间混响;
- 动作层:脚步、衣物、门、拉链、呼吸;
- 叙事层:对白、广播、无线电、音乐进入或停止。
对白则写清四件事:谁说、从哪里说、怎么说、准确说什么。
例如:
BOY(无线电画外音,很远,带轻微失真):“Mara?”
BOY(从她手中的对讲机传出,清晰、非常靠近、平静):“Don’t turn around.”
同一句声音,位置一变,剧情就变了。

一份可以直接复制的30秒骨架
【输出规格】
30秒、16:9、写实电影质感,开启原生音频。
不要自动字幕、屏幕文字、标志或水印。
【参考素材分工】
@图片1:只锁定主角身份、面部和发型,不参考背景。
@图片2:只锁定主角服装、体型和装备。
@图片3:只锁定场景结构、空间方向和主光源,不参考人物。
@视频1:只参考动作路径、速度和节奏,不参考演员外貌。
@音频1:只参考主角音色,不照搬原内容。
【一句话故事】
[主角]为了[目标]进入[地点],却发现[异常],最终[结果或尾钩]。
【连续性锁定】
全片始终保持同一名主角、同一套服装、同一件核心道具和同一个连续空间。
人物身份、服装细节、光线方向与移动方向保持一致。
【时间轴】
00—03秒|立即可见或可听见的异常。
03—08秒|建立人物、地点与目标。
08—16秒|主角行动,并发现新信息。
16—24秒|障碍靠近、误判失效或危险升级。
24—30秒|不可逆动作、结果或强尾钩。
每一段都补充:
人物动作 + 新信息 + 摄影机反应 + 声音变化。
【对白】
CHARACTER(声音位置,表演方式):“Exact dialogue.”
【表演与摄影】
表演克制、自然,用眼神、呼吸和手部停顿表现情绪。
动作符合物理规律。
【声音】
环境层:[环境声]
动作层:[脚步、衣物、道具、呼吸]
叙事层:[对白、广播、音乐进入或停止]
【禁止事项】
不要变脸、改变年龄、复制人物或增加无关路人。
不要改变服装与道具颜色,不要破坏空间方向。
不要出现漂浮物、错误手指、穿模、随机字幕、标志或水印。别再用“太AI了”评价失败
“太AI了”不是能帮助下一轮修改的意见。
你得指出,到底哪里出了问题。
- 人物换脸:身份参考不明确,或多张脸互相冲突;
- 动作错序:同一时间段塞入太多动作;
- 人物瞬移:场景结构和移动方向没有锁定;
- 对白说错人:没有写说话者和声音位置;
- 前三秒无聊:先解释背景,后发生事件;
- 结尾像断电:没有设计最后画面、最后声音和观众的新问题。
“这一版不够高级”没有下一步。
“第12秒人物右手拿起书包,第15秒书包却跳到左手;请锁定书包始终由右手持有,并保留原机位、光线和人物身份”,才有。
具体,才有下一轮。
把形容词擦掉,留下决定
回到开头那句:
一个女孩在雨中奔跑,电影感,紧张,手持摄影,超写实,8K。
它不是不能用。
它只是应该出现在最后,而不是最前面。
先决定女孩是谁,为什么跑,跑向哪里,中途发现什么,最后做出什么选择。
再决定镜头、光线和质感。
写30秒提示词时,先别问模型能不能做。
先问自己:
这一秒发生了什么?
观众新知道了什么?
为什么还要继续看?
当这三个问题清楚以后,提示词不会只是变长。
它会开始像一段戏。
关注波妞,了解更多 AIGC 视频知识