Wan 3.0 提示词指南:官方六大公式,从一句话到多镜头剧本
阿里官方 Wan 3.0 创作手册的提示词方法论精炼版:基础、进阶、首尾帧、声音、参考、多镜头六大公式,每条都配一段可直接复制的提示词原文和它生成的成片。

阿里发布 Wan 3.0 时附了一份创作手册,而手册里最有用的部分不是功能清单——是六条提示词公式,每一条都带着自己的范例和范例生成的成片。这些内容几乎没有在中文以外的世界里被完整讲过。
本文就是那一节的拆解:下面每一条公式都出自手册本身,每一段提示词都按原文完整印出,你可以直接粘进 Playground。手册给某条提示词配了成片的,成片就嵌在旁边。
以下内容全部可以在 Pixo Playground 的 Wan 3.0 中运行——最长 30 秒,带原生音频。
提示词能调动的资源
在公式之前,先看清它们所处的边界。Wan 3.0 的输入限制格外宽裕,而其中好几条公式,只有知道了这些数字才说得通:
| 交互项 | 限制 |
|---|---|
| 提示词 | 不超过 20,000 字符 |
| 首尾帧图片 | 和参考模式互斥——输入首尾帧时,不再支持参考输入 |
| 参考图片 | 不超过 10 张 |
| 参考视频 | 不超过 5 个,总时长不大于 15 秒 |
| 参考音频 | 不超过 5 个,总时长不大于 15 秒 |
| 文件/网页 | 二选一,且数量不超过 1 个——docx、doc、xlsx、xls、pptx、ppt、pdf、txt、md。这是模型层面的能力;Pixo Playground 目前尚未开放,只支持提示词、首尾帧与参考素材 |
| 分辨率 | 480p / 720p / 1080p |
| 时长 | 无视频输入时支持 2–30 秒;有视频输入时,输入时长与输出时长之和不超过 30 秒 |
其中两条会直接改变你的写法。20,000 字符的上限,正是多镜头公式得以成立的前提——写十个带台词的镜头也远远用不完。而首尾帧 ↔ 参考的互斥,是一个必须在动笔之前就做出的岔路选择:要么给 Wan 一张画面然后描述运动,要么给它一批参考素材然后描述谁做什么。没有哪条提示词能两者兼得。
这些分类上限并不会加总成一个「20 个参考素材」的额度——发布时广泛流传的正是这个说法。它们是彼此独立的预算:10 张图片,以及各不超过 5 个、且各自总时长不超过 15 秒的视频与音频。
公式 1 —— 基础:谁在哪里干什么
手册的入门起点,面向第一次生成 AI 视频的人。只有三段,不多不少:
提示词 = 主体 + 场景 + 运动- 主体 —— 视频内容的主要表现对象。手册在这里刻意放得很宽:可以是人、动物、植物、物品,或非物理真实存在的想象物体。它是提示词其余部分挂靠的锚点,也是唯一一段不能省略、不能留给模型去猜的。
- 场景 —— 主体所处的环境,包含背景与前景,可以是真实空间,也可以是虚构场景。省掉它,模型替你挑;写明它,你就已经定下了大半个画面。
- 运动 —— 什么在动,动多大。手册给的范围值得记住:运动包含静止、小幅度运动、大幅度运动、局部运动或整体动势。「运动」不只是动作——声明某个东西保持静止,同样是一条运动指令,而且 Wan 3.0 会照办。
基础公式也是最能从开头一个风格词里获益的一条。下面是手册里那条黏土动画表格中的农场条目,篇幅只比一条微博长一点,却讲完了一个完整的小故事:
手册中同类范例的原文提示词
手绘风格动画,油画笔触,色调偏冷,美国郊外农场上,一个外星飞碟从远处飞来,飞碟下射出绿色光柱,将农场中的一只奶牛吸走了,不远处二楼房间中的小男孩看到了这一幕。对着公式读一遍:先是风格词,然后是场景(美国郊外农场),然后是主体(飞碟),然后是三个连着的运动节拍(飞来、射出光柱、吸走奶牛),最后是第二个主体,而他的运动是看到。两句话,每一段都填满了。这才是基础公式真正要求的标准——不是长度,是覆盖度。
公式 2 —— 进阶:再加三段
基础三段成为习惯之后,手册再加三段。顺序不变,直接往后接:
提示词 = 主体 + 场景 + 运动
+ 美学控制 + 风格化 + 音效前三段在这一层也各自获得了描述——手册把每一段拆成名词本身和挂在它上面的细节:
- 主体描述 —— 对主体外观特征细节的描述,用形容词或短句列举。手册的例子:「一位身着少数民族服饰的黑发苗族少女」、「一位来自异世界的飞天仙子,身着破旧却华丽的服饰,背后展开一对由废墟碎片构成的奇异翅膀」。要的是具体名词和材质,不是关于情绪的形容词。
- 场景描述 —— 对环境特征细节的同等待遇,也是那段悄悄决定了你的光的槽位。写出表面材质和它的状态(「龟裂的橙色干涸土地」「被雨淋湿的金属栏杆」),渲染才有东西可以反光;只写「一个农场」,它什么也没拿到,还给你的就是一片平均的环境光。
- 运动描述 —— 幅度、速率,以及运动作用的效果。手册那三个例子精确地就是这三件事:「猛烈地摇摆」、「缓慢地移动」、「打碎了玻璃」。第三个才是有意思的那个——描述后果,本身就是一条运动指令。
然后是新增的三段:
- 美学控制 —— 光源、光线环境、景别、视角、镜头、运镜。这是摄影指导的那一段,也是绝大部分「制作水准感」的来源。这里含糊,模型就给你一个平光下的安全中景。
- 风格化 —— 画面风格语言的名字。手册的例子:「赛博朋克」、「勾线插画」、「废土风格」。一两个词,放在靠前的位置,承担着惊人的工作量。本文末尾的风格词表就是十二个这样的词,并附上触发它们的写法。
- 音效 —— 背景音效、背景音乐、人物台词、旁白。而且关键在于:音色是可以用词描述的,比如低沉混合的声音、可爱的声音。公式 4 会把这一段彻底拆开。
手册的灾难片条目就是进阶公式的完全展开:一段承载风格、主体与氛围的全局段落,然后十个编号分镜,最后一段给整片配乐。它的开头部分:
手册中同类范例的原文提示词
这是一段30秒的真实电影质感海上巨兽登场场景,整体氛围参考好莱坞灾难怪兽大片。故事从一艘在暴雨狂风中艰难航行的小型渔船开始,船身上清晰可见 “WAN” 的标识。镜头先建立恶劣海况与渔船渺小脆弱的状态,再逐步通过海面异动、水下阴影、船体震动、海浪异常隆起等细节制造压迫感,最终一头体型庞大、形象类似《环太平洋》怪兽风格的深海巨兽从海底破浪而出。整体要求写实、厚重、真实比例、强烈水体冲击、暴雨与闪电下的大光比氛围,强调电影级特效质感、海水体积感、怪兽皮肤湿润细节和巨物压迫感。
分镜1:夜晚暴雨海面,真实电影质感,广角镜头展现一艘小型渔船在巨浪中艰难前行,船体老旧、湿滑、被海浪不断拍打,船身侧面清晰可见白色字母 “WAN”。海面波涛汹涌,狂风卷起雨幕,天空乌云翻滚,远处闪电短暂照亮整片海域。画面强调真实海水、暴风雨环境、船体细节和渺小无助感。
分镜2:中近景镜头靠近渔船船头或甲板侧面,海浪猛烈拍打船身,海水冲过甲板,缆绳、渔网、金属栏杆在风雨中剧烈摆动。镜头随着船体起伏产生真实摇晃感,雨水不断打在镜头前景和船体表面。船身上的 WAN 标识再次短暂进入画面。整体强调真实材质、恶劣天气、湿漉漉的金属和木质结构、强烈生存危机感。
分镜3:镜头从渔船视角看向前方海面,暴雨中原本混乱的海浪出现不自然的巨大隆起,像有什么庞然大物正在海底快速接近。海面形成巨大漩涡与异常翻涌,浪峰被从下方顶起,海水流向紊乱。闪电照亮海面时,隐约可见深海下方模糊而庞大的黑影。画面突出悬疑感、海面压迫感与巨物逼近的恐怖预兆。注意每个分镜由什么构成。每一段开头都先点明一个景别(广角 / 中近景 / 主观视角),结尾都收在一句导演意图上——「画面强调真实海水、暴风雨环境、船体细节和渺小无助感」。这句收尾是手册最值得偷学的习惯:描述完画面里有什么之后,再说这个画面是为了什么。而在中间部分,发生在船上的分镜会逐项列出材质(湿滑的金属、木质结构、缆绳、渔网、栏杆),发生在开阔海面上的分镜——比如分镜 3——则一样也不列:那里没有可触摸的东西,细节预算就全部让给了水的行为。
同一条提示词里的音效那一段,是收尾的一整段,把 30 秒当作一条弧线来配:
配乐采用好莱坞灾难怪兽电影风格。开场以低沉环境音、深海般的低频轰鸣、稀疏鼓点和压抑弦乐营造暴风雨中的不安感;随着海面异动逐渐加入更强的低音脉冲、金属撞击感和不断堆积的弦乐张力;在巨兽即将浮出水面前,音乐进入几乎屏息般的悬停和持续上升;巨兽破浪而出时,爆发出巨大的铜管、重型打击乐和低频冲击,形成灾难级高潮;结尾以厚重、压迫、末日感极强的长音和鼓点收束,强化巨兽矗立海面的史诗感。四个状态,分别钉在四个故事时刻上。这是一张音乐提示表,不是一个形容词——它就是「电影感配乐」与「怪兽出水那一刻音乐正好砸下来」之间的差距。
公式 3 —— 图生/首尾帧:只写运动和运镜
当你给出首帧(或首帧和尾帧)时,图像已经把主体、场景和风格都定死了。在提示词里重述它们,轻则浪费预算,重则制造冲突。所以公式收缩成两段:
提示词 = 运动 + 运镜- 运动 —— 结合图像中实际可见的元素来写:这个人、这只动物,奔跑、打招呼。手册特别点名可以用形容词来控制动态的程度与速度,如*「快速地」、「缓慢地」*。因为画面已经固定,这些副词几乎就是你剩下的全部控制面。
- 运镜 —— 只在你确实想要的时候写。写得直白就行:「镜头推进」、「镜头左移」。反过来同样重要——如果希望镜头不要发生变化,手册说要明说,用*「固定镜头」*来强调。在这里保持沉默,并不等于要一个锁死的机位。
手册那条水墨刀客是全书最清晰的首帧案例。输入一张图;提示词是一份带时间戳的分镜表,里面几乎每一行都是一条运镜或运动指令,而风格只在最末尾被提到一次——那是一条「保持输入画面的样子」的提醒,不是一次新的美术指导。以下是它五段中的第一段:
该案例的参考文件

该公式的官方手册原文提示词
(0:00 - 0:03) 运镜:中景。
画面:沿用 @Image1 的水墨竹林场景。头戴斗笠、身着墨色长袍的刀客,其剪影伫立在浓雾环绕、竹影婆娑的中心。
动作:刀客左手轻按刀柄,竹叶随风飘落。
氛围:寂静,压抑,水墨晕染的颗粒感清晰可见。这一段是用带标签的行写成的,而标签是按每段需要挑的,不是固定的:五段里只有运镜每段都出现。画面和细节出现在大多数段落里;剧情、动作、打斗、氛围和文字则随内容需要出现或缺席。稳定的是那个形状——运镜在前,然后每个关注点一行,一行只管一件事。另外注意,画面在这里的作用是说沿用 @Image1,而不是把它再描述一遍。第二段则展示了标签如何随剧情到来而变化:
(0:03 - 0:08) 剧情引入,运镜:特写。
剧情:刀客察觉杀气。
画面:镜头快速推进到刀客斗笠下的特写。
细节:斗笠边缘露出一双凌厉、决绝的眼睛,眼神如刀。水墨晕染的“汗珠”从额头滑落。
动作:刀客右手缓缓握紧刀柄,指关节泛白。竹叶飘落的速度加快。有两点可以推广。第一,真正在干活的是那些形容词——快速推进、缓缓握紧、竹叶飘落加快:程度和速度,正是公式要的。第二,这条提示词的结尾又一次点名了源图,并要求它的黑白水墨风格贯穿整段。有首帧时,风格指令是一条保持指令。
公式 4 —— 声音:人声、音效、配乐
Wan 3.0 原生生成音频,所以声音不是后期——它是提示词文本。手册给了一条公式和它下面的三条子公式,而子公式才是有用的部分:
提示词 = 人声 + 音效 + 背景音乐(BGM)
人声 = “角色说话的内容” + 情绪 + 语调 + 语速 + 音色 + 口音
音效 = 音源材质 + 行为 + 环境音
BGM = 背景音乐/配乐 + 风格人声。 六段,第一段没得商量:把原话写出来。手册的例子是一个讲脱口秀的男人,他说道:「好好学习,天天向上」,语气轻松,语速适中,声音清亮,美式英文。注意口音那一段和你写提示词用的语言是彼此独立的;而「音色」是可以用日常语言描述的——手册在别处给的是低沉混合的声音、可爱的声音。
音效。 三段的存在,就是为了不让你写出「一声闷响」。手册的例子:一个玻璃小球从桌面掉在木质地面上,发出「砰」的声音,室内安静环境。 材质、行为、环境。把材质换成橡胶,同一句话产生的声音就完全不同;把材质省掉,你拿到的是所有材质的平均值。
BGM。 最短的一条子公式,而手册的例子说明它属于附着在场景上的,不是漂浮的:雨夜,阴森窄小的走廊,尽头有一扇窗户,配有悬疑风格背景音乐。 场景和风格,一口气说完。
三条子公式没覆盖到的一种情况,是以上传而非描述形式到来的音频——对此,手册参考素材表里有一条舞蹈条目:把一个音频文件交给 Wan,然后用整条提示词描述身体该如何回应它:
手册中同类范例的原文提示词
竖屏9:16,全身镜头,固定稳定机位。一位长黑发的年轻女性,身穿白色花朵刺绣长袖上衣、白色百褶短裙配黑色腰带、白色厚底运动鞋,在现代简约风厨房中,跟随固定音频的节拍跳偶像风舞蹈。背景为浅灰色橱柜、白色岛台、深色夜景窗户,人物身后有一块方形补光灯形成轮廓光,室内冷白色灯光。
根据固定音频的节奏、速度和情绪起伏进行舞蹈编排:鼓点重拍对应干脆利落的大幅度动作与定格姿势,舒缓段落对应柔和的身体波浪与手部姿态,副歌高潮段落动作更密集更有爆发力。整体为偶像风舞蹈,动作连贯流畅,富有节奏感和表现力,与音频节拍完全同步。
运动流畅,肢体比例自然。第二段是一份映射表,不是一段描述:重拍 → 这类动作,舒缓段 → 那类动作,副歌 → 更密更爆。这就是任何上传音频的通用做法——你不是在描述音乐,你是在告诉 Wan 画面该如何回应音乐的每一种状态。
公式 5 —— 参考:先 @ 素材,再指挥它
参考生视频用来在生成的片段里保持你上传的人、景、声的一致性。公式是三段:
提示词 = @参考对象 + 动作 + 台词- @参考对象 —— 按上传顺序给素材编号并点名:
@图片1、@视频2、@音频1。手册最关键的一条提示:同一个素材可以在提示词的不同位置多次 @,这正是让绑定从大致变成精准的办法。@ 不是在开头做一次的声明——它是一个指针,哪里适用就往哪里放。 - 动作 —— 参考对象的运动状态:静止、表情情绪变化、肢体动作、外力动作、位移变化。一张参考图是一个姿势,没有动作那一段,模型倾向于围着这个姿势打转,而不是从它出发。写明运动状态,才把一张静图变成一次表演——而「静止」是一个合法答案,不是空答案。
- 台词 —— 他们说什么。支持单主角说话或多主角对话,而且音色本身也可以是参考:「音色参考@音频1」。
同一条公式下还挂着两个变体:
- 视频时序参考 —— 参考一段视频的时序内容而非它的主体:动作、运镜、特效。手册的写法:「参考@视频1的运镜方式」。
- 白膜参考 —— 输入一段灰模 3D 预览,把它转成成片。手册直接给了可以照抄的句子:「将 3D 预览视频转化为正式成片,把预览视频中……换成……角色。」
手册自己那条童话范例,是三段同时出现的最紧凑演示:
这是一个充满童趣的童话场景。@图片1 在草地上蹦跳着玩耍,@图片2 在旁边的一颗苹果树下弹奏钢琴,一颗苹果掉到了@图片2 的头上,@图片1 参考@音频1的音色,开心地指着@图片2 说:「你要变成科学家了!」
三个素材,六次 @,一句完整写出的台词。@图片1 出现两次——一次作为动作的主体,一次作为说话者;@图片2 出现三次——弹钢琴的人、苹果砸到的那颗头、被指着的那个对象。这就是「哪里适用就再 @ 一次」这条提示的实际样子:素材在每一个它参与的位置都被重新点名,而不是在开头声明一次。
下面是同一套语法用在一张分镜图上的样子,来自手册的参考素材表。一张上传的分镜图变成六个镜头:
该公式的官方手册原文提示词
参考 @Image1 的分镜图,镜头1:雨夜小火车站台全景,长发女孩撑蓝色雨伞独自站在站台上,身后小站房透出暖光,远处青山隐没在雨雾中;镜头2:中景,女孩撑伞与背书包的短发男孩在站台上面对面站立,大雨倾盆,铁轨在两人之间延伸;镜头3:透过雨滴滑落的透明伞面拍摄女孩面部特写,她眼眶泛红,轻声说{到了那边记得发消息};镜头4:从男孩背后越肩拍向女孩方向,远处一列火车亮着车头灯缓缓驶来,雨幕中光晕扩散;镜头5:双手特写,女孩将一张折叠的纸条递到男孩手中,指尖微微颤抖;镜头6:女孩独自站在站台边,目送铁轨延伸向远方,男孩已不在身旁,雨势渐弱。注意台词的花括号——轻声说{到了那边记得发消息}。手册用花括号把要说的原话从周围的描述里圈出来,这在任何旁白与台词挤在同一句里的提示词中都是个好习惯。
公式 6 —— 多镜头:把提示词当分镜脚本写
最后一条公式,正是 20,000 字符预算存在的理由。它在一次生成里产出连贯的多镜头叙事,并在切镜之间保持主体、场景和氛围的一致:
提示词 = 总体描述 + 镜头序号 + 时间戳 + 分镜内容- 总体描述 —— 简要概述整个视频:故事主题、叙述风格、主要情感、核心事件。它的存在是为了让模型在动手拍第 1 个镜头之前先有一个全局判断,也是让第 7 个镜头和第 1 个镜头还在同一部片子里的东西。
- 镜头序号 —— 给每个镜头编号。这是结构的脊椎;没有它,一条长提示词读起来就是一段没有断句的连写,切镜位置由模型自己决定。
- 时间戳 —— 每个镜头占用的时间范围,也正是把分镜表和实际输出长度绑在一起的东西。30 秒里放十个镜头和放三个,是两部不同的片子,而时间戳就是你说清是哪一部的方式。
- 分镜内容 —— 逐个镜头写清人和物的具体行为:动作、语言、表情、姿态。在一个镜头内部,你写的就是一条普通的单镜头提示词——前面几条公式原封不动地适用。
手册的范例故意写得很小,好让结构看得见:
这个故事以第三人称视角,讲述了一个关于放弃与重拾希望的短剧。 第1个镜头[0-3秒]一个男孩在操场的角落独自坐着,低头望着手中的信纸,随后轻轻叹气,眼神中透露出迷茫。 第2个镜头[4-6秒]硬切转场,固定机位,聚焦于男孩的眼睛,泪光闪烁,带着失落和无助。 第3个镜头[7-10秒]硬切转场,场景转至一间简朴的教室。一个女孩眼神温和而坚定,穿着朴素的衣着,面带温和而坚定的笑容,走到男孩的身边安慰他。
一句总述,然后三个镜头,每个都带编号、带方括号时间范围、带进入它的转场方式、带机位、带表演。四句话,十秒成片。
放大之后,同一副骨架就能撑起一支 30 秒短片。手册那条西海岸一镜到底,开头是总体描述加上一段人物设定,然后是四个带时间范围的编号镜头——而第一个之后的每一个镜头都以「不切镜」开头,这正是一份分镜表如何产出连续长镜头而不是四个独立片段的办法:
手册中同类范例的原文提示词
这是一段30秒电影级高强度单镜头(One-Take)视觉奇观短片,整体风格定位为“西海岸街头幻想主义”,视觉语言融合了90年代街头滑板录像的粗粝感与现代商业大片的精致质感。画面整体采用极致的“加州阳光”电影级调色,高饱和度的蓝色天空与阳光直射下的棕榈树影子形成强烈的对比,空气中弥漫着柏油马路的炙热感、购物车轮摩擦的金属声以及一种无所畏惧的青春叛逆气息。空间透视随着主角的极速滑行不断被拉长,镜头通过极低角度的跟随与极高动态的物理穿梭营造强烈的视觉冲力。
主角是一位穿着撞色条纹衫、带着黑色棒球帽的潮酷少年,神情从最初的慵懒松弛瞬间切换为冲破极限的亢奋;第二个场景的主角则是同一个少年,但他以一种“审视者”的姿态出现在现实维度。
第一个镜头 0-6s:
起幅为特写镜头,少年慵懒地躺在一辆红色铁质购物车内,背景是加州标志性的笔直大道与高耸入云的棕榈树。随着音乐节奏爆发,摄影机执行一个极速的向后拉远并下沉至地面,以极低角度紧贴车轮。少年开始在陡峭的公路上俯冲,购物车在路面上剧烈颠簸,两侧的汽车急速倒退,镜头捕捉到一种近乎疯狂的加速感。
第二个镜头 7-15s:
不切镜,摄影机像一个滑板手般紧紧贴地跟随,镜头在少年越过一个简易木质斜坡的瞬间,顺势执行一个优美的抛物线拉升。购物车腾空而起,摄影机从购物车底部穿过。此时,前方的巨型商业广告牌迅速占据整个视野,镜头以一种不可思议的“准心式”推进,直指广告牌中心。
第三个镜头 16-24s:
不切镜,少年连同购物车以一种“破裂次元壁”的方式直接嵌入了巨大的广告牌中。原本三维的身体在接触海报的瞬间发生“扁平化”质变,画面中出现真实的纸张撕裂纹理与彩色故障墨迹。少年保持着滑行的姿态,却化为了广告牌上的一幅平面艺术作品。摄影机在此时执行一个180度的水平环绕,并在高空进行一个俯冲降落,重回地面。
第四个镜头 25-30s:
不切镜,镜头平滑降落至广告牌正下方的街道,画面中出现另一个“真实”的少年。他停下脚步,缓缓压低帽檐,带着一丝玩味的微笑抬头望向广告牌上那个“被定格”的自己。摄影机顺着他的视线执行一个快速的变焦推近,最终定格在广告牌上“WAN”字样旁那个被撕裂的洞口。背景音乐融合了高能的嘻哈节奏与胶片卷动的物理声,视觉信息高度凝练且充满时尚反叛力。同一套编号镜头的抬头写法,用在单个镜头上也一样成立,手册的喜剧条目就是这么写的——一整个 30 秒长镜头,它的全部结构就是在两张脸之间快速摇镜,在抬头处声明一次,然后一行一行地执行:
手册中同类范例的原文提示词
镜头1 [0秒-30秒]
近景,平视视角,连续快速摇镜,一镜到底(单镜头连续无缝运镜):
画面左侧是身穿黑色潮流导演马甲、戴着高档专业工作耳麦的导演,其左下方放置着一台巨大的专业电影摄像机。右侧是妆容精致、留着时尚韩式逗号刘海、身穿高定制西装的关系户小鲜肉。背景是宽敞的专业影棚拍摄现场,可见巨大的绿色幕布、数个高耸的影视级C型灯架、缠绕的电线,以及在背景中穿梭忙碌的灯光师和化妆师等工作人员。
专业影棚人工光。柔和的LED柔光箱光源从右侧洒入,将三位主角的面部均匀照亮,场景色彩饱满。背景的摄影器材与绿幕在充足的影棚灯光下投射出淡淡的阴影,呈现出真实而忙碌的现代化大制作片场质感。完整提示词接下来是一整段很长的正文,把导演的一句台词、一次甩镜到演员脸上、以及一段描述好的反应轮着来,一共六轮——每一轮台词都完整写出,每一次摇镜都重复一遍「镜头不要切镜」。当一个镜头要扛完整部片子时,重复本身就是指令。
风格词表:十二种质感和触发它们的写法
手册开篇那张表是十二个条目,每个都是一个题材,配一条完整提示词和它生成的成片。当成参考来读,它其实是一本短语手册:第二列才是真正定下质感的那句话,而且它几乎总是待在提示词的第一句里。
| # | 类型 | 触发它的那句话 | 成片 |
|---|---|---|---|
| 1 | 情绪写实 | 甚至能看到皮肤真实的质感 + 带着一点点人手持拍摄时的轻微呼吸感和晃动 | |
| 2 | 悬疑电影 | 一段现代悬疑风格的电影感长镜头 + 强烈的淡绿色滤镜风格 | |
| 3 | 喜剧短片 | 连续快速摇镜,一镜到底(单镜头连续无缝运镜) | |
| 4 | 创意短片 | 30秒电影级高强度单镜头(One-Take)视觉奇观短片 | |
| 5 | 科幻动画 | 超写实 CGI + 生物机械结构 + 高反差电影照明 | |
| 6 | 灾难电影 | 真实电影质感 + 整体氛围参考好莱坞灾难怪兽大片 | |
| 7 | 荒诞短片 | 充满了冷幽默与荒诞感 + 严格遵循明亮的“青橙配色”体系 | |
| 8 | 3D 风格化动画 | 一段共4个镜头场景的3D动画奇幻短片 + 指定主色调:青蓝、墨绿、月白 | |
| 9 | 精美 2D 动画 | 一段精致的日式2D卡通动画短片 + 戏剧化的逆光效果 | |
| 10 | 2D 运动番 | 日式运动番质感的2d动画 | |
| 11 | 暗黑奇幻 | 3D动画短片,30秒,暗黑奇幻题材,单镜头 + 冷白月光硬光主导,高对比低调打光 | |
| 12 | 手绘动画(手册中的「黏土动画」行) | 手绘风格动画,油画笔触,色调偏冷 |
读这张表还有几点值得说。第 12 行在手册里标的是黏土动画,但它的提示词要的是手绘油画笔触动画——标签描述的是表格行,提示词描述的是输出,而决定质感的是提示词。第 3、4、6、12 行的成片,就是本文前面用过的那几段;手册自己也在不同章节间反复使用它们。
更有用的一点:注意这里几乎没有单个词。那些能撑住 30 秒的写法,都是把一个媒介(「2D 动画」「3D 短片」「电影感长镜头」)和一条光或色的规则(「高反差电影照明」「青橙配色」「冷白月光硬光主导」)配成一对。单写「赛博朋克」,你得到的是一次猜测;写「赛博朋克,高对比霓虹主光,低饱和阴影」,你得到的是一种可以在多个镜头之间重复的质感。
把六条公式串起来
这些公式是嵌套关系,不是竞争关系。实际操作上:
- 从基础开始。 主体、场景、运动。如果一句话已经很接近了,那就到此为止——Wan 3.0 确实能一句话成片。
- 哪里让你失望,就在哪里补进阶那几段。 画面发平?那是美学控制。太普通?那是风格化。没声音或配错了?那是音效那一段。
- 动笔前先选输入模式。 首尾帧或参考,不能都要。有首帧时,除了运动和运镜什么都别写。有参考时,反复 @ 它们,并把台词完整写出来。
- 故事有中段时,就用多镜头公式。 总体描述、镜头序号、时间戳、分镜内容。想要一整条连续长镜头而不是一串镜头,就在镜头之间加上「不切镜」。
在 Pixo 上跑起来
- 到 pixo.video 注册——新账号自带免费 credits。
- 打开 Playground,模型选 Wan 3.0。
- 粘贴本文任意提示词,附上你的参考素材,然后生成——2 到 30 秒,480p 到 1080p,带原生音频。


