字节跳动 发布了新一代视频创作模型 Seedance 2.5。对做视频的人来说,这次变的不只是画质:一条视频能装下一整场戏,一次能同时指挥几十份参考素材,改片子的时候还能定位到第几秒。 https://tu.aixq.cc/wp-content/uploads/2026/08/20260804100353823.mp4 科技新闻。
画幅比例
这些任务中被自动锁定的参数不能在生成页面或接口中另行指定,其余参数以当前可用选项为准。
提示背景与起因
提示词可以按照下面的公式灵活组合:
以下热门的运镜方式可以直接使用;若画面中有多个主体,仍需说明运镜围绕谁、从哪里开启、到哪里结束。
涉及精确转场时,还要写清触发时刻、遮挡物、镜头运动方向、切换方式,以及切换后需要保持的构图或运动趋势。
提示事件经过
不要只依赖图片中的文字标注,也不要让模型自行判断多份素材分别对应哪个人物、道具或场景。
当台词文本是英语,但模型说成中文,或者需要控制地区语言习惯时,可以在台词前进一步明确语言。推荐公式:
无缝转场的目标是让画面与声音自然衔接。提示词可以要求保持两段原视频的主要内容,但不能把生成式过渡理解为逐像素不变的剪辑拼接。
提示各方回应
时长
不必罗列所有面部细节。单次情绪转折通常选择 2 至 4 个最明确的表现即可;只有当情绪包含多次转折时,才需要按触发事件分阶段描述。
可以组合使用图片、视频和音频。素材较多时,提示词的重点不是把全部素材都写进同一句话,而是明确人物、道具、场景、动作和声音之间的对应关系。
提示影响分析
普通叙事优先使用“阶段”。只有关键交接、进出场、转场或明确节拍需要控制时,再使用以 1 秒为单位的时间表达。时间区间适合分配剧情节奏,时间点适合指定一次关键事件,相对时间适合描述事件之间的等待关系。
保持<花艺师>和<店员>的身份、服装、工作台方向、剪刀位置和花束归属稳定。
支持纯文本生成,也支持同时参考图片、视频和音频进行创作,并可对已有视频进行编辑。]
如果多张图片是同一个人物或商品的不同视角,可以明确写成:
不要合并成“图片1和图片2作为首尾帧”。首帧和尾帧应使用相同画幅。其他参考图只提供指定属性,不替代首尾帧的构图。
视频延长是在原视频边界之外继续创作。输出比例自动保持输入视频比例,延长时长由用户设置。
过于小众、行业含义不统一或模型可能不熟悉的术语,应保留术语名称,同时把它翻译成可以直接观察的画面变化。
白模参考分为粗粒度白模和细粒度白模。粗粒度白模主要提供动作、动线、站位、运镜、切镜、光影和声音等时序信息;细粒度白模已经具有完整结构,主要用于材质、色彩、人物、场景和视觉风格的重渲染。先判断白模负责运动骨架还是完整建模,再选择对应写法。
当参考视频已经准确给出动作、运镜和顺序时,提示词只需说明继承哪些内容,不必逐动作复述;重复描述可能与素材本身冲突。白模视频主要提供运动和空间骨架,仍需要写清希望生成的主体、场景、动作和风格。
视频编辑、首帧或首尾帧生视频、视频延长会根据输入素材自动锁定部分生成参数,具体规则如下。
延长结果的音量可能与原视频存在轻微变化;使用同代模型生成的视频继续延长时,画面与声音通常更容易自然衔接。验收时需要同时检查边界前后的画面、声音和完整延长片段。
推荐按照下面的顺序组织:
上传参考素材后,需要说明每份素材具体提供什么。素材中的人物、背景或构图容易被误带入成片时,再写明不采用什么。
画幅比例
时间段应连续、不重叠。时间段表示事件的时间预算,不是精准剪辑点,动作可能在边界附近提前或延后。一个时间段中的内容过少会增加模型的发挥空间,内容过多则可能造成过度切镜或剧情遗漏。
当多张独立图片分别定义过程中的不同阶段时,提示词第一句先写“以@图片1至@图片N的顺序作为关键帧”,再逐张说明每张图对应的关键状态。独立关键帧通常比把多个画面拼在一张宫格图中更容易对齐,但它控制的是阶段顺序和关键状态,不等于逐帧复刻。
相比 2.0,Seedance 2.5有主要突破:
台词不是中文时,建议在台词前明确语言:
细粒度白模已经具备完整人物、道具或场景结构,适合更换材质、色彩、人物形象、场景和整体视觉风格。白模画面应尽量干净,不要保留轨迹线、坐标轴、控制器或相机锥体等制作标记。
推荐范围
视频无缝转场是在两段视频之间生成连续的过渡内容。提示词需要先说明哪一段是转场前视频、哪一段是转场后视频,再写清触发动作、镜头运动、画面如何变化、最终到达的状态和声音衔接。
逐一声明素材职责,并说明哪些素材在向前延长片段中使用、哪些只在原视频起步后使用。这样可以减少后续人物、道具或特效被提前带入前置片段。
提示词重点
先描述原视频尾帧的连续状态,再描述尾帧之后发生的内容。
优先使用关系清楚的简单几何体。手臂、翅膀等附属结构只有在动作序列完整时才适合作为白模信息,否则容易造成动作僵硬或结构误判。
提示词可以直接使用自然语言。需要进一步区分音乐、音效、台词和字幕时,可以使用下面的特殊字符:
事件较多时,建议把故事拆成连续阶段。每个阶段只安排一个主要状态变化,并写清楚该阶段结束时画面中可以直接看到的状态。
画幅比例
不需要的部分可以省略。生成参数不需要写进提示词;可调参数由生成页面或接口设置。
时长
可以组合使用最多 50 份参考素材。不同类型素材分别遵循下面的输入范围,推荐范围用于提高生成稳定性,不代表能力上限。
主体图超过 5 个主体且仍需要多视角时,建议把不同视角拆成多张图片;多张独立视角图通常比把多个视角拼在一张图中更稳定。
主体图可扩展至 9 至 12 个主体,主体音视频可扩展至 6 至 10 个主体,视频编辑参考图可扩展至 6 至 8 张;素材越多,稳定性越容易下降。
边界画面应追求视觉上的自然衔接,不应理解为逐像素完全相同。
只写“紧张、温馨、压抑”等情绪词,模型可以理解整体方向,但具体表演方式会有更多发挥空间。如果希望稳定控制人物演技,建议写明眼神、眉头、嘴角、呼吸、视线和手部动作等能够直接看到或听到的表现。
素材要求
推荐范围
生成一段花店订单包装流程说明视频。<花艺师>和<店员>共同完成花束整理、包装和交付。
先描述原视频开始之前发生的内容,再把原视频首帧写成延长片段的明确结束状态。只写“随后承接原视频”可能使模型提前引入后续人物或特效,或者到达目标状态后再次改变画面。
一键成片适合把多张图片,或图片与风格参考视频,组织成具有统一节奏和包装风格的完整视频。提示词需要说明每份素材的职责、图片顺序、画面动态、剪辑节奏、视觉包装和声音;不要只写“把这些素材做成视频”。
需要控制字幕或声音时,可以直接写明保留和不采用的声音类别。画面内容仍优先使用正向描述,只有素材职责、编辑范围和容易误带入的内容需要明确限制。
字节跳动给发布了一份官方提示词指南:从一句话生成,到 50 份参考素材怎么调度、30 秒长片怎么分段、改片子怎么只动一处,每类任务都配了能直接抄用的模板。对用即梦或 API 做视频的人,这是第一份成体系的官方写法手册…
在多模态参考模式中,可以直接在提示词首句写明@图片1作为首帧、@图片2作为尾帧,不必切换到单独的首尾帧模式。系统会以首帧画幅锁定输出比例,时长由生成页面或接口设置;首帧与尾帧应使用相同画幅,比例不一致时尾帧可能出现拉伸。其余参考图仍可分别定义人物、道具、场景和材质。
适合情况
编辑已有视频时,先把原视频定义为唯一母版,再说明编辑对象、作用范围、目标素材和保持内容。编辑任务的输出比例自动保持输入视频比例,输出时长自动基本保持输入视频时长,这两项不支持另行设置;受输入帧处理影响,输出时长可能存在最大约 0.3 秒的差异;差异通常来自过渡帧处理,整体内容和事件顺序仍基本保持。
当同一人物需要跨场景使用多份素材时,可以增多主体设定:
宫格分镜用于给出整体故事、镜头顺序和大致构图,不适合要求每格细节严格复刻。建议控制在15 格以内,使用简洁线稿或干净示意图并减少文字标注。提示词应明确读取顺序,再写出每格的主体动作、景别或运镜、最终画风和声音。
粗粒度白模适合锁定动作轨迹、运动方向、人物站位、进出场、机位路径、切镜位置、光影变化和声音节奏。白模中的每个几何体都应单独映射到最终主体或道具;人物、道具和场景外观可以由其他参考图片定义。
素材要求
本指南中的示例仅用于说明提示词写法。实际生成效果可能受到输入素材、任务复杂度和生成参数影响。
输入范围
图片顺序重要时,应逐张写明出现顺序;允许模型自由编排时,也要明确写出“可按主题自由编排”。涉及多个人物或多个商品时,仍需逐一命名并绑定素材。
提示词重点
先逐一说明其他素材负责什么,再明确原视频负责延长边界。其他素材可以提供人物、道具或声音,但不能替代原视频尾帧对起始画面的控制。
向后延长时,延长片段的第一个画面需要承接原视频尾帧;向前延长时,延长片段的最后一个画面需要衔接原视频首帧。除了边界画面,还要保持人物、道具、背景、运动趋势和声音连续。
光圈、焦距和快门数值可以写入提示词,但最终画面的可见后果通常比单独写一个数值更明确。
输入范围
输入范围
适合情况
输入范围
推荐范围
时长
原视频向前延长向后延长首帧尾帧边界画面必须连续
这种写法没有明确哪张图片对应哪个角色。
多素材创作的目标是让模型在当前场景中选择正确素材,不要求所有素材同时出现在画面中。
对白、语言、音色、背景音乐和音效可以分别处理。提示词需要写清说话人或声音类别、目标变化,以及其他声音是否保持。
推荐范围
基础镜头语言和热门运镜方式可以直接写进提示词。术语较少见、可能存在多种理解,或需要精确控制画面变化时,应同时说明术语作用于谁、画面如何变化,以及希望看到的结局。
不同人物、商品和道具需要分别绑定素材:
本文由作者@小互AI,原创/授权发布于平台,未经许可禁止转载。