CQTAI
豆包 Seedance 2 · 视频

提示词指南NEW

Seedance 2.0 原生支持音视频联合生成(generateAudio 可一并出声)。本渠道支持文生视频与图生视频(最多 2 张参考图)。本指南精简自官方文档,帮你把创意写成模型听得懂的指令。

一句话理解

Seedance 2.0 本质是一个多模态 AI 导演:读取文字与参考图,并在内部拆成「空间层(画面里有什么)」和「时间层(如何随时间变化)」。所以好提示词不是「文案型形容」,而是「工程型指令」——谁、在什么场景、做什么动作、镜头如何运动、按怎样的时间顺序发生。

基础公式:两种生成方式

本渠道只提供两种方式:纯文字(文生视频)与「文字 + 参考图」(图生视频)。参考图最多 2 张,也可用首帧 / 尾帧图。暂不支持以视频 / 音频作为输入,也不支持在已有视频上编辑或延长。
① 文生视频
只用文字描述生成视频,适合无参考图、纯凭创意的场景。
<主体> + <动作 / 表情> + <场景环境> + <运镜> + <风格 / 画质> + <约束词>
② 图生视频
以参考图锁定主体 / 场景外观,再用文字描述动作与镜头。最多 2 张参考图(imageUrls),或指定首帧 / 尾帧图(firstFrameUrl / lastFrameUrl)。
参考<图片N>中的<主体 / 场景>,让其<做什么动作>,<镜头如何运动>
首尾帧:以首帧图开场、尾帧图收尾,中间<描述过渡与动作>
参考图需公网可直连;多主体时把每个主体绑定到具体图片(见下方「定义主体」)。

进阶公式:八要素

精准主体 + 动作细节 + 场景环境 + 光影色调 + 镜头运镜 + 视觉风格 + 画质 + 约束条件

先锁定「谁」在「干什么」,再交代「在哪」「什么氛围」,然后告诉模型「怎么拍」,最后用风格、画质、约束词把结果收紧。

① 定义主体

  • 句式:将<图片N>中的[2~3 个稳定静态特征]定义为<主体N>(如服饰、发型、外观)。
  • 多主体:分别定义并用唯一、稳定的标签区分,后续持续使用同一标签(如「警察」「小偷」)。
  • 未定义主体的简单场景:每次用 <主体>@<图片N> 强调绑定,如「张三@图片1」(本渠道最多 2 张参考图)。
  • 描述简洁、避免语义冲突;空间关系优先用参考图表达。

② 使用分镜时序

模型内部空间与时间解耦。复杂视频最理想的形态是「时间轴化分镜」:用 镜头1 / 镜头2 / 镜头3 按事件顺序描述,每个镜头 = 谁 + 在哪 + 做什么 + 镜头怎么动。

✗ 反面
「男人在街头紧张地奔跑,画面很有电影感。」
✓ 正面
镜头1 街巷侧拍缓慢起跑;镜头2 撞翻水果摊、快速摇镜给惊恐特写;镜头3 翻墙消失、缓慢拉远定格。

每个镜头建议按此顺序:运镜/切换 → 主体动作与表情 → 位置/空间变化 → 音频信息。

💡 模型对精确秒数(如 0~3 秒)支持不稳定,别强行限制时长,让它按剧情自然生成节奏。

③ 动作描述

  • 肢体细化 + 程度量化:具体到手/腿/头/肩背,补幅度、速度、力度(缓慢抬手、快速转头、用力蹬地)。
  • 优先低缓连续小动作,规避狂奔、大跳、剧烈翻滚等高爆发动作。
  • 补动作过渡衔接:写明前后动作的惯性承接(借转身惯性顺势抬手)。
  • 情绪具象外化:用身体细节替代「很悲伤」「非常愤怒」等抽象词。
抽象情绪外化为动作与细节
悲伤低头、肩膀微颤、眼眶泛红、手指攥紧衣角、泪水打转未落
喜悦嘴角上扬、眉眼舒展、脚步轻快、下意识哼歌、原地转圈
紧张 / 焦虑频繁看表、手指敲桌、呼吸急促、眼神闪躲、啃指甲
愤怒双拳紧握、下颌紧绷、胸口起伏、眼神锐利、从牙缝挤出话
释然长舒一口气、肩膀放松、淡淡微笑、抬头望向远方

④ 运镜写法

模型对标准运镜术语理解力很强,直接使用即可:中景、特写、全景、缓慢推镜、平稳横移、固定镜头。

一个镜头尽量只指定 1 种运镜,别同时推拉摇移,否则画面易不稳定。

⑤ 画质、风格与约束词

  • 画质高清、细节丰富、电影质感、色彩自然、光影柔和。
  • 风格赛博朋克冷蓝紫、复古胶片、日系清新、2D 日漫、3D 国风。
  • 约束词十分重要,能规避瑕疵与不合理元素——
保持无字幕 / 避免生成任何文字或字幕
不要生成 Logo
不要生成水印

⑥ 特殊字符规范

合理使用符号有助于模型区分信息类型:

信息类型符号示例
音乐()(背景播放快节奏摇滚乐)
音效<><远处传来狗叫声>
台词{}{你好,世界};小语种需标注语种,如 用日语说{こんにちは}
字幕【】【第一章:启程】
台词语言需统一,避免中英文混用(专有名词除外)。

⑦ 参考图配置策略

本渠道最多 2 张参考图(imageUrls),运镜、节奏、氛围一律用文字描述——没有视频 / 音频输入。把有限的参考图用在最该锁定的东西上:角色锚定(锁外观)或场景定调(锁环境与风格)。

💡 典型配置:角色图 1 张 + 场景图 1 张;或首帧图 + 尾帧图(firstFrameUrl / lastFrameUrl)。角色图用人脸清晰的单人独照,别用多视图拼图。想要声音时把 generateAudio 设为 true,并用特殊字符规范描述台词 / 音效 / 音乐。

常见问题速查

现象解决
人物 ID 漂移 / 换脸单独准备人脸大头照 + 全身照,重要素材前置;不要用人物多视图。
莫名出现字幕加「保持无字幕」;优先横屏生成(竖屏更易出字幕)。
出现 Logo / 水印加「不要生成 Logo」「不要生成水印」。
风格漂移(写实↔动漫)加明确风格约束词(如「2D 日漫风格」);或先把参考图转成目标风格。
双胞胎 / 人物重复明确人物-参考图对应(张三对应图片1);末尾加全局约束「禁止同款分身/双胞胎」;用单人独立照;精简提示词。
中文发音不准把易读错字换成同音常用字(螭龙山→吃龙山)。
没有声音 / 声音不理想先确认 generateAudio 设为 true;再用特殊字符规范写清台词{}、音效<>、音乐(),并补音色特征描述。本渠道无参考音频输入,音色只能用文字描述。