创作指南
AI 视频提示词怎么写?镜头、运动、光线与一致性完整模板
一套适用于主流 AI 视频模型的提示词方法,拆解主体、动作、场景、镜头、光线、节奏和声音,并提供可直接修改的中文模板。

查看文章目录
先说结论
好用的 AI 视频提示词不是形容词堆砌,而是一份简短的镜头说明。最通用的结构是:
主体 + 明确动作 + 场景 + 景别与角度 + 镜头运动 + 光线与色彩 + 风格与节奏 + 声音 + 约束
先把一个短视频拆成一个个镜头,再为每个镜头写清“画面里有什么、怎样运动、摄影机怎样拍”。相比一次要求模型生成复杂剧情,这种方式更容易控制人物、节奏和转场。
AI 视频提示词为什么容易失控
视频比图片多了时间维度。提示词中的多个动作可能同时竞争,例如“人物转身、跑向汽车、打开车门、坐进去、汽车起步”,模型需要在几秒内完成五个状态变化,常见结果是动作缺失、肢体变形或空间关系跳跃。
因此,一条提示词最好围绕一个主要镜头和一个核心动作。复杂广告或剧情应拆成分镜,分别生成后再剪辑。
九个提示词组成部分
主体
写清人物、动物、产品或环境的稳定特征。人物可以包含年龄段、发型、服装和显著配饰;产品应包含材质、颜色、形状和 Logo 位置。
不要每个镜头都换一种描述。同一个角色应复用相同的核心描述,并尽量使用同一张参考图。
动作
使用可以观察到的动词,例如“缓慢抬头”“沿街道向前走”“水滴从瓶身滑落”。“充满希望”“非常高级”属于情绪或风格,不能替代具体动作。
场景
说明地点、时间、天气、前景和背景。场景越复杂,越应该明确主体与背景的空间关系,例如“人物站在画面右侧,左后方是一扇打开的窗”。
景别
常用选择包括特写、近景、中景、全景和远景。产品材质适合特写,人物动作适合中景,强调环境规模适合全景或远景。
摄像机角度
平视显得自然;低角度容易表现力量和规模;俯拍适合展示布局或弱小感;鸟瞰适合城市、道路和大场景。角度会改变叙事含义,不只是视觉装饰。
镜头运动
Google 的 Veo 官方提示指南列出了静态、平移、倾斜、推轨、横移、升降、变焦、摇臂、航拍、手持和环绕等常见运动。写提示词时通常只选一种主要运动,避免同时要求“推近、环绕、快速摇摄”。
需要区分“推近”和“变焦”:推近是摄影机向主体移动,会改变空间透视;变焦是改变焦距,视觉感受不同。
光线与色彩
可以写光源方向、软硬、时间和综合色调,例如“清晨窗外柔和侧光,低对比度,冷灰背景配暖色肤色”。这比只写“电影感光线”更具体。
风格与节奏
写清写实、动画、广告、纪录片或复古胶片等方向,同时描述运动速度,如“缓慢、克制”“快速、紧张”。避免混合太多冲突风格。
声音和约束
如果模型支持原生音频,可以描述环境声、对白、音乐氛围和声音出现的时间。模型不支持时,这部分应留给后期制作。
约束用于说明不希望出现的关键问题,例如“不要出现字幕、Logo 不变形、画面中只有一个人”。负面要求不宜过长,优先保留真正影响交付的硬约束。
一条完整提示词示例
假设要制作咖啡产品短片:
一只磨砂黑色咖啡罐放在深色木桌中央,罐身金色标签清晰且结构不变。
清晨的咖啡馆,背景虚化,一缕蒸汽从旁边的咖啡杯缓慢上升。
产品特写,摄影机从左向右缓慢横移,最后轻微推近标签。
窗外暖色侧光勾勒罐体边缘,低饱和棕金色调,精致商业广告风格,节奏舒缓。
环境中有轻微咖啡馆人声和瓷杯碰撞声。不要出现额外文字,不要改变标签内容。
如果模型无法稳定完成“横移后推近”,应拆成两个镜头,而不是继续增加形容词。
可复制的通用模板
【主体及稳定特征】位于【场景与空间位置】,正在【单一核心动作】。
【时间、天气和背景细节】。
【景别】,【摄像机角度】,【一种主要镜头运动】。
【光源、对比度和主色调】,【视觉风格】,【节奏】。
声音:【环境声、对白或音乐】。
约束:【必须保持的元素】;不要出现【关键禁用元素】。
图生视频时再增加一段:
以输入图片作为首帧,保持人物身份、服装、产品结构和画面色调;
只让【指定对象】发生【指定变化】,其余元素保持稳定。
如何保持人物和产品一致性
- 使用清晰、主体无遮挡的参考图。
- 每个镜头复用完全相同的核心人物或产品描述。
- 一次只改变动作、角度或场景中的一个主要变量。
- 先生成角色定妆图,再以定妆图制作视频。
- 把最满意的上一镜头末帧作为下一镜头参考。
- 后期统一色彩、字幕和 Logo,不把所有工作都交给生成模型。
一致性不是提示词单独能解决的问题,它同时受到模型能力、参考图支持、镜头复杂度和后期流程影响。
一个 15 秒视频如何拆分
以产品广告为例,可以拆成:
| 时间 | 镜头目的 | 推荐写法 |
|---|---|---|
| 0—3 秒 | 建立环境 | 全景或中景,单一平移 |
| 3—7 秒 | 展示主体 | 产品特写,缓慢推近 |
| 7—11 秒 | 展示使用过程 | 中景,一个明确动作 |
| 11—15 秒 | 收束与品牌露出 | 静态或轻微运动,字幕后期添加 |
每段分别生成,可以独立重试,也方便替换表现不稳定的镜头。浏览墨智 AI 模型广场时,可以优先查看视频模型支持的输入方式、时长、比例和参考图参数。
常见问题
提示词越长越好吗
不是。提示词应该完整,但不能包含互相冲突的动作和风格。删除与核心画面无关的形容词,通常比继续加词更有效。
应该写中文还是英文
先使用你最容易准确表达的语言。不同模型的训练和提示词解析方式不同,重要项目可以保留同一含义的中英文版本做小样测试,但不要默认英文一定更好。
为什么每次生成结果都不同
生成模型具有随机性,模型版本和参数也会影响结果。保存提示词、参考图、模型版本、比例和种子等可用参数,才能复现并比较。
参考来源
内容制作说明
本文由 AI 辅助创作、人工审核;事实、来源和表达在发布前均经过人工复核。
MOZHI AI MODELS
把方法用于下一次创作
浏览墨智 AI 当前可用的文本、图像、视频与音频模型,按任务选择合适能力。
查看可用模型