Seedance 2.0:如何把参考图用作首帧
Seedance 2.0 不允许同时设置首帧图和参考图。官方文档给出的变通办法只需一行提示词。我们实测了它到底管不管用。

Seedance 2.0 会逼你二选一。你可以给它一张精确的首帧图,也可以给它角色、场景和色彩的参考图。两者同时提交,请求就会失败。
官方文档里确实留了一条绕过去的路,只需要一行提示词。它的效果比字节跳动自己的文档所暗示的要好,而且大多数时候你根本用不上它。
为什么首帧图和参考图不能一起用?
Seedance 2.0 有三种接受输入的方式,彼此不能混用。一是文生视频。二是图生视频,你提供首帧,也可以再加一张尾帧。三是全能参考,你最多可以附加九张图片、三段视频和三段音频,让模型从中取材。
只能选一个。字节跳动的文档把它们列为彼此独立的场景,由你为每个附件设置的 role 决定:图生视频用 first_frame 和 last_frame,全能参考用 reference_image、reference_video 和 reference_audio。它们不能组合。把首帧图和参考图一起提交,请求会被拒绝。
这是个问题,因为真实的镜头通常两边都需要。你有一个必须和上一场戏保持一致的角色、一个已经确立的场景、一套要匹配的色彩方案,同时你也很清楚开场画面应该是什么样。API 却逼你放弃其中一边。
文档确实给了一条出路。它写在 Seedance 2.0 系列教程的"进阶用法"一节里:"对于全能参考视频生成,你可以通过提示词把参考图指定为首帧/尾帧,间接实现'首尾帧 + 全能参考'的效果。"接着它又留了余地——如果你需要画面与所提供的图片严格一致,还是该用图生视频。
我们要验证的正是这句留有余地的话。我们找到的每一篇第三方 Seedance 指南都在重复这个写法;没有一篇检查过它实际生成了什么。
如何把参考图设为首帧?
把所有图片都作为参考图附加上去,包括你想用作开场的那一张。然后在提示词里点名这一张。
以下是我们使用的设置。四张图片,按此顺序附加:




提示词如下:
@Image 4 as the first frame. The courier arrives at a late-night noodle stall and hands the parcel to the vendor. @Image 1 is the character reference - keep the face, hair and jacket exactly as shown. @Image 2 is the noodle stall - match its awning, lanterns and signage. @Image 3 is the colour and lighting reference - match its palette. Rain falls steadily throughout. No subtitles, no captions, no watermark, no logo.
生成结果如下:
它以包裹开场,而快递员、面摊和配色也都同时保留了下来。
这个数字指的是图片在你提交的列表中的位置,而不是你指定的名称。@Image 4 就是请求中的第四张图,所以顺序一变,这行字指向的就是另一张图。
把这句话放在开头。我们测试时每次都放在开头,所以无法告诉你把它埋在提示词中间是否仍然有效。
你真的能拿回那张原图吗?
这两个画面中,有一个是我们提供的参考图,另一个是 Seedance 据此生成的首帧。

所有静止的部分都原样回来了:纸上的褶皱、麻绳交叉打结的方式、手指的位置、背后的散景。唯一的差别是雨,而它必然不同:这是一段运动影像的首帧,雨滴正在下落途中。
字节跳动用的词是"间接",这让人以为你只能得到大致的想法和大致的构图。而我们拿回的是那张图本身。如果你的开场画面必须是某张特定的图,这条路能让你做到,同时不必放弃其他参考图。
在最严格的场景下,我们仍然会听从文档的建议。如果开场画面必须和上一段的尾帧无缝衔接,几个像素的偏移就会露出跳切,那就用图生视频,并接受失去参考图的代价。除此之外,这个方法都管用。
它到底什么时候才有用?
当你附加的图片中不止一张有可能成为开场镜头时,这行字才真正有价值。
在我们的四图设置中,面摊是个合理的候选:它是一个地点、一个场景,而提示词描述的正是抵达那里。不写首帧那行字时,片子就以面摊开场。我们真正想要的包裹特写被忽略了。
加上那行字,结果就反过来了。
没有首帧那行字
加了一行字
所以这行字并不是打开首帧控制的开关。它裁决的是一场竞争,只有当两张或更多图片都有理由争夺开场镜头时才起作用。只有一个候选时,可以不写。有两个或更多时,不写就意味着让模型替你选。
具体措辞重要吗?
我们测试了三种写法:
| 我们写的内容 | 结果 |
|---|---|
| "@Image 4 as the first frame." | 以预期的图片开场 |
| "The video opens exactly on @Image 4 - an extreme macro of rain striking a brown paper parcel tied with red twine, held in two black-gloved hands, background blurred to neon bokeh. Hold that framing for a beat." | 以预期的图片开场 |
| "The first frame must be @Image 4 - identical composition, framing and lighting. Do not reinterpret it." | 以预期的图片开场 |
这三种写法替换的都是开头那一句,提示词的其余部分每次完全相同。
没有差别。详细描述图片没有带来变化,命令模型不得偏离也没有带来变化。真正起作用的,是有没有点名这张图。
用最短的那句就行。
什么时候完全不需要这行字?
如果只有一张图可能用作开场,模型不用你说也知道。为了验证这一点,我们做了一组实验:附加一张图,却在提示词里只字不提。两组的提示词逐字相同,都没有提到任何机位或地点。唯一的区别是请求中是否多了那一张图。



两组完全相同的提示词:
The courier makes a late delivery in the rain-slick neon district at night. @Image 1 is the character reference - keep the face, hair and jacket exactly as shown. @Image 2 is the colour and lighting reference - match its palette. Rain falls steadily and the courier moves through the scene. No subtitles, no captions, no watermark, no logo.
其中没有任何一句描述了航拍镜头,也完全没有提到机位。
不附加那张图时,片子以平视视角在街道上开场,中规中矩。附加了却从未提及时,它从头顶开场,机位正是参考图中的那个航拍位置——而提示词从未要求过这个角度。
未附加航拍图
附加了航拍图,但只字未提
所以,仅仅附加一张参考图,本身就足以决定你的开场镜头。如果你想用作开场的那张,是你附加的图片中唯一像"场景"的一张,那么首帧那行字给你的,是你本就已经拥有的东西。
如果附加了图片却从不提及会怎样?
这和上面是同一个发现,只是换到你的工作流角度来看。
你出于某个理由附加的图片,可能会左右生成结果的另一个部分。你为了配色加了一张色彩板,如果它看起来像个场景,它可能顺手把开场镜头也拿走了,而提示词里根本没提到它。
有两个办法。只要请求中还有别的像场景的图片,就点名你的开场图;同时删掉你不需要的参考图。每多一张图,就多一个候选者,去争抢一个你并没有指派的任务。
这个结论可能不成立的地方
以上全部基于 Seedance 2.0、每次测试一个场景、英文提示词。Seedance 2.5 记录了同样的限制,但我们没有实测。另外,我们只在一个场景中确认了其他参考图能与被点名的首帧共存,这足以说明它不会默认失效,但不足以保证它永远不会失效。
操作步骤
- 把每张图都作为参考图附加,包括你的开场镜头。
- 记住你想用作开场的那张的位置。这个数字就是它在请求中的序号。
- 如果附加的其他图片中有任何一张可能被读作场景,就在提示词开头加上
@Image N as the first frame.。 - 删掉任何你并不真正需要的参考图。每多一张图,就多一个去争抢你并未指派的角色的候选者。
在 Pixo 中,参考图按你添加的顺序附加,所以编号和你在镜头工作区看到的一致。如果你要点名某一帧,生成前值得看一眼。如果你刚接触这个模型,我们的 Seedance 2.0 完整指南介绍了它其余的输入模式,导演式提示词指南则更深入地讲镜头语言。你可以在 Pixo 上试用 Seedance 2.0,这一切都已经配置好了。


