最终效果

做完以后,你会得到一条 15 秒 的横向视听短片。画面不是随机拼接,而是按三个时间段连续推进:
| 时间 | 屏幕上发生什么 | 同时听到什么 |
|---|---|---|
| 0–5 秒 | 镜头贴近暗色水面滑行,一滴彩色全息液体落下,扩散成深色磨砂玻璃卡片;卡片翻面后出现专辑封面 | 清晰的水滴声,随后淡入低沉的氛围音乐 |
| 5–10 秒 | 镜头聚焦一张卡片,荧光绿色进度条拉成长光带,穿过三维岩石,连接到悬浮的手机和极简笔记本电脑 | 音乐逐渐增强,并出现顺滑的科技掠过声 |
| 10–15 秒 | 镜头穿过电脑屏幕进入明亮液态空间,发光标题跟随节拍脉冲,所有光线最后汇聚成指定标志 | 标题变化与重拍同步,声音在标志出现时收束 |
这个结果只使用两张必要图片:第一张决定界面风格和世界氛围,第二张决定片尾标志。Seedance 2.0 负责把文字中的镜头、动作和声音组合成视频。教程后半还会说明怎样加入参考视频、参考音频,或者只修改已有视频的一部分。
给每份素材分配任务
Seedance 2.0 可以同时理解文字、图片、视频和音频,但“上传了什么”不等于“模型知道它应该负责什么”。开始前,先把素材用途写成一句清楚的分工。
| 素材类型 | 最适合负责的内容 | 提示词中的写法 |
|---|---|---|
| 图片 | 人物或产品外观、材质、首尾帧、场景色调和构图 | @image1 作为界面风格和场景氛围参考 |
| 视频 | 摄影机运动、人物动作、转场节奏和镜头速度 | 参考 @video1 的镜头运动与节奏 |
| 音频 | 旁白语气、音乐情绪、环境声和节拍位置 | @audio1 作为背景音乐与节拍参考 |
| 文字 | 时间线、动作、镜头要求、对白和不能改变的限制 | 0–5 秒:镜头贴近水面向前滑行…… |
不要只写:
@image1 @image2 @video1,生成一条有电影感的 15 秒视频。
模型必须猜测三份素材的作用,常见结果是画面用了图片风格,却没有采用视频里的镜头运动,或者把标志图片当成开场背景。
改成下面这样,分工才明确:
@image1 作为界面风格和场景氛围参考。
@image2 作为最后一帧的标志参考。
参考 @video1 的摄影机运动和镜头节奏。
生成一条 15 秒的科技音乐视觉短片。
写完后,你应该能用一句话回答每个文件“只负责什么”。回答不出来的素材先不要上传,它只会增加模型需要猜测的内容。
上传并标记参考素材
进入支持 Seedance 2.0 多模态输入的创作页,新建视频。在素材区先上传两张图片:
@image1:暗色界面、磨砂玻璃卡片或液态科技空间的风格板。它决定开场到结尾的色彩、材质和界面气氛。@image2:干净、边缘清楚的品牌标志。它只在最后一帧出现,不负责前面场景的构图。
上传后,确认输入框里可以用 @image1、@image2 指向对应缩略图。不同入口的编号顺序可能由上传次序决定,因此要对照缩略图,不要凭文件名猜。
如果还要复用某段摄影机运动,再上传 2–15 秒 的短视频并记为 @video1;如果要跟随现有音乐,再上传音频并记为 @audio1。公开指南给出的实用上限是最多 9 张图片、3 段视频、3 段音频,图片、视频和音频合计 12 份;具体入口可能调整限制,以上传页当时显示为准。
第一次练习不需要把额度用满。两张图片已经足够完成本篇的十五秒示例。
写出十五秒时间线
不要把十五秒写成一段散文。把时间切成 0–5 秒、5–10 秒、10–15 秒,每段分别说清镜头在哪里、主体如何变化、声音如何进入。
0–5 秒:镜头贴近暗色水面向前滑行。一滴彩色全息液体落入水面,柔软流体向外迸开并变成漂浮的深色磨砂玻璃卡片。卡片翻转,露出层叠排列的专辑封面。声音:先出现清晰水滴声,再淡入柔和的氛围低音。
5–10 秒:镜头聚焦其中一张卡片。荧光绿色进度条延展成一条光带,穿过三维岩石,继续流入悬浮的手机和极简笔记本电脑。界面保持轻微发光。声音:音乐逐渐增强,动作经过设备时加入顺滑的科技掠过声。
10–15 秒:镜头穿过笔记本电脑屏幕,进入明亮的液态空间。发光标题随节拍脉冲,随后所有光线汇聚成 @image2 中的标志。声音:标题脉冲与强拍同步,在标志完整出现时收束。
每一段都使用能看见的物理动作,例如“落下、迸开、翻转、延展、穿过、汇聚”。只写“画面变得更高级”或“切到下一幕”,模型不知道该如何运动。
完成后,从头读一次:5 秒时应从卡片转到光带,10 秒时应从设备转到明亮空间,15 秒应明确停在标志。三个节点都清楚,视频才有可预测的起点、变化和结尾。
组合完整提示词
一条好用的 Seedance 提示可以按这个顺序组成:
[素材] + [素材负责什么] + [什么时候发生什么] + [摄影机如何运动] + [声音如何变化] + [必须遵守的限制]
把前面的内容合并成下面这条完整提示词:
@image1 作为界面视觉风格和场景氛围参考。
@image2 作为最后一帧的品牌标志参考。
0–5 秒:镜头贴近暗色水面向前滑行。一滴彩色全息液体落入水面,柔软流体向外迸开并变成漂浮的深色磨砂玻璃卡片。卡片翻转,露出层叠排列的专辑封面。声音:先出现清晰水滴声,再淡入柔和的氛围低音。
5–10 秒:镜头聚焦其中一张卡片。荧光绿色进度条延展成一条光带,穿过三维岩石,继续流入悬浮的手机和极简笔记本电脑。界面保持轻微发光。声音:音乐逐渐增强,动作经过设备时加入顺滑的科技掠过声。
10–15 秒:镜头穿过笔记本电脑屏幕,进入明亮的液态空间。发光标题随节拍脉冲,随后所有光线汇聚成 @image2 中的标志。声音:标题脉冲与强拍同步,在标志完整出现时收束。
限制:所有英文文字必须拼写正确、结构完整、没有变形。整个视频保持 @image1 的材质、色彩和界面风格。最后的标志必须保持 @image2 的轮廓与比例,不添加其他标志。
在生成设置中选择 15 秒,提交提示词。结果出现后先完整播放一次,重点看三件事:片头是否来自 @image1 的世界、三个时间段是否按顺序发生、最后是否收束到 @image2 的标志。某一段错误时,先改那一段的动作和时间,不要继续堆“震撼、顶级、高级”等形容词。
锁定人物产品与场景
当视频里有真实人物或结构固定的产品时,一张正面图通常不够。镜头转到侧面后,模型会补想象中的脸、接口或材质。解决方法是给不同参考图分配更窄的职责,再明确哪些细节不能变化。
锁定人物可以这样写:
@image1 作为人物正脸参考。
@image2 作为人物侧脸参考。
@image3 作为服装参考。
所有镜头保持相同的脸型、发型、服装剪裁和颜色。
锁定产品可以这样写:
@image1 作为产品整体轮廓参考。
@image2 作为产品侧面结构参考。
@image3 作为表面材质参考。
@image4 作为拉链和五金细节参考。
镜头运动时不得改变产品比例、开口位置、材质和五金数量。
锁定场景可以这样写:
@image1 作为暖色咖啡馆灯光参考。
@image2 作为木质桌面纹理参考。
整个片段保持相同的琥珀色温、桌面材质和空间布局。
注意 作为首帧使用 和 参考 的区别:前者要求视频从那一幅具体画面开始,后者只借用人物、材质或气氛。需要精确开场时写首帧;只想继承风格时写参考。
复用镜头和转场方式
如果你已经找到一段喜欢的推镜、环绕或转场视频,不必用很长的文字重新描述。上传为 @video1,先说“参考它的什么”,再说“新的画面拍什么”。
只复用镜头运动:
参考 @video1 的全部摄影机运动和镜头节奏。
生成一名角色独自在走廊中的紧张场景。角色恐慌时使用快速推拉效果,随后进入缓慢环绕镜头。
复用人物动作与另一段环绕镜头:
@image1 作为新角色参考。
@image2 作为仓库环境参考。
参考 @video1 的身体动作,参考 @video2 的环绕镜头方式。
生成两名角色在仓库中的对抗场面。
复用某种转场时,不要笼统写“像参考视频一样”。例如:
参考 @video1 的拼图碎裂转场效果。
使用 @image1 作为主体;画面碎裂后,露出 @image2 中的产品标志。
这样只借用镜头或效果的工作方式,新主体、环境和标志仍由你自己的素材决定。
延长或局部修改视频
已有视频方向正确,只是结尾不够长时,上传为 @video1 并使用延长功能。设置的时长是新增加的部分,不是原片加延长后的总时长。例如已有 9 秒,想再增加 6 秒,就选择 6 秒,并且只描述新出现的六秒:
将 @video1 延长 6 秒。
0–2 秒:镜头向上倾斜,霓虹招牌闪烁后亮起。
2–4 秒:咖啡杯冒出蒸汽,门打开,暖色街灯进入室内。
4–6 秒:标题“Breakfast Served / 7:00–10:00”淡入。
如果原视频的镜头已经正确,只想换一个局部,就先写必须保留的内容,再写要改变的内容:
保留 @video1 原有的环境、摄影机路径和动作节奏。
把角色头发改成长红发,并让 @image1 中的鲨鱼在背景里缓慢升起。其他内容不变。
或者:
保留 @video1 的餐厅环境和原始摄影机路径。
增加一个近景:店主把印有 @image1 标志的纸袋递给顾客。
预览时先确认被要求保留的镜头和动作没有变化,再看局部修改。若镜头也被改掉,把“保留原有摄影机路径”移到提示词第一句,并减少同时修改的项目。
用声音控制情绪与卡点
音频不只是最后配上去的背景。它可以告诉模型动作有多重、转场有多快、哪一拍应该换画面。
需要一种说话语气时:
@audio1 作为旁白语气参考。旁白保持平静、自信、克制,使用贴近麦克风的高级广告语气。
需要沿用参考视频里的环境声时:
参考 @video1 中的雨夜城市环境声,保留远处车流和轻微脚步声的空间感。
需要画面卡音乐强拍时,让音频负责节奏、图片负责内容:
@audio1 作为节拍参考。
@image1、@image2、@image3、@image4 作为四个画面内容参考。
只在强拍处切换场景。每个主要重拍触发一次场景变化、文字出现或主体缩放,转场能量随音乐增强。
生成后打开声音完整播放。正确的结果不是“有一条背景音乐”,而是水滴、掠过声、文字脉冲和场景切换都出现在相应动作附近。如果画面总比音乐慢,不要只写“更卡点”,直接指出哪一拍触发哪一个动作。
最终检查这四项即可:每份素材都有明确任务;提示词按时间写而不是写成故事段落;镜头和转场使用具体动作;最后一帧、文字拼写和标志保持完整。四项都成立时,Seedance 才不需要猜这条视频应该怎样完成。
