Seedance 2.0 vs Fast vs Mini:便宜的那档够用吗?(2026)
三档 Seedance 2.0 各跑了一遍,共 28 条片段,提示词和价格全部公开。便宜那档撑得住——真正的问题是你需要抽几次。

ByteDance 把 Seedance 2.0 分成三档发布:Seedance 2.0、Seedance 2.0 Fast 和 Seedance 2.0 Mini。同一个模型家族,三种价格。
想要结论的话:默认用 Mini,把省下来的钱花在多抽几次上。 六条提示词跑下来,没有哪一档稳定胜出——贵的那档漏掉了便宜那档抓到的细节,反过来也一样——所以这个选择与其说是哪个模型更好,不如说是你能负担多少次尝试。需要 1080p 和 4K 时再升到完整版 Seedance 2.0,这是唯一一个不靠掷硬币的优势。Fast 比 Mini 贵 60%,却从没拉开过明显差距。
一条 5 秒片段要多少钱:
| 配置 | 每条 5 秒片段成本 |
|---|---|
| 2.0 @ 480p | $0.35 |
| 2.0 Mini @ 720p | $0.38 |
| 2.0 Fast @ 720p | $0.61 |
| 2.0 @ 720p | $0.76 |
| 2.0 @ 1080p | $1.89 |
加粗的两行价格差不多。也就是说,大约 $0.36 买到的要么是低分辨率下的顶配模型,要么是高分辨率下的最便宜模型——这是两个旋钮,不是一个,而几乎所有人只会去拧档位那一个。我们在下文测了另一个,结果并不像价格暗示的那样。
能力相同,价格三种
ByteDance 自己的文档说,这三档「支持的功能基本相同」,规格表也印证了这一点——除了分辨率上限,其余全部一致:4–15 秒时长、全部六种画幅比例、原生音频、首尾帧控制、九张参考图、三段参考视频、视频编辑与续接。
唯一的功能差异:Fast 和 Mini 止步于 720p。 旗舰版可以到 1080p 和 4K。
三者的价格比是干净的 2 : 1.6 : 1。Mini 正好是旗舰版的一半,而 Fast 尴尬地卡在中间。
而多出来的钱并没有买到额外能力。让三档生成同一条 5 秒 720p 片段,它们计费的工作量完全相同——各 108,900 个视频 token——价格不同只是因为费率不同:每百万 token 分别为 7.0、5.6 和 3.5,旗舰版的 1080p 输出则单独在 7.7 这一档。所以旗舰版必须在画面上把钱赚回来,靠更锐利的细节,或者靠交出你要求的构图和细节。它到底做到没有,就是这篇文章剩下部分要讲的。
我们怎么测的
我们用完全一致的参数——720p、五秒、开音频——把六条提示词跑遍三档。然后把要求最苛刻的那条镜头延长到 10 秒和 15 秒,加了一轮 480p 来测分辨率那个问题,再加一条 1080p 作为最高档的样本。28 条片段,$22.19,全部列在下面。
每条提示词都印在它生成的片段上方,你可以自己拿去跑任意一条。
有两点要说清楚。每条片段都是一次生成——没有挑选,没有取平均。而且你自己跑同样的提示词也拿不回这些片段。Seedance 不会重复一次生成,即使给同一个 seed 也不会——ByteDance 自己也这么说:同一个 seed 值产出的是「相似的结果,但不保证完全一致」。我们在三档上都验证了这一点。
让一张照片动起来
让一张照片动起来——宠物、宝宝、或者你自己——是大家最想从 AI 视频里得到的东西之一,而我们能找到的所有分档对比里都没有它。我们给三档同一张源照片和九个随手写的英文单词:
make the dog dance, keep his face the same
2.0
2.0 Fast
2.0 Mini
三档都保住了狗的身份——同一张脸,同样的毛色,同一个房间。区别在于镜头里发生了多少事。旗舰版的尾巴在整段里摇动,头也会歪;Mini 基本一直坐着。 说清楚:没有哪一个真的在跳舞。但其中一个在努力——Mini 忠实地还原了主体,然后对它做得更少。这是我们最常看到的模式,不过每条提示词只抽了一次,我们没法告诉你它有多可靠。
口播镜头
竖屏、有台词、手机式构图——这是量最大的真实使用场景,也是对口型出问题时最明显的场景。这一条请把声音打开。
A woman in her late 20s sits in a bright home kitchen, holding a small skincare bottle up to the camera, talking directly to the viewer like a friend. Natural handheld phone framing, vertical. She says: "Okay so I've been using this for three weeks and I genuinely cannot go back. Two drops, morning and night, that's it." Warm daylight from a window on her left. Casual, unpolished, real — like a TikTok, not a commercial. No text on screen.2.0
2.0 Fast
2.0 Mini
三档都交付了要求:竖屏手机构图、一个真实的厨房,以及可信的台词表演——三档的口型都对得上。除此之外它们很难区分——每一档都保持了眼神接触,把瓶子留在画面里,并且五秒内一直是同一个人。旗舰版的厨房最亮、反差最大;Mini 的偏暗偏平,高光与阴影之间的过渡最柔。这是取向的差别,不是质量的差别。
在这个量最大的使用场景上,便宜那档没有让你看到任何损失。
产品镜头
反光台面上的一瓶香水是这类对比里的默认演示素材——wiro 让它浮在黑色水面上,Cutout 在黄金时刻的光线里推近一瓶——所以我们也跑了一条。这里本来是我们最看好旗舰版轻松取胜的地方。
Luxury perfume bottle on a polished marble surface, slow camera orbit, golden light, water droplets on the glass, cinematic product commercial2.0
2.0 Fast
2.0 Mini
它没有。按提示词而不是按审美来评判,旗舰版和 Mini 都交出了每一个要素:瓶子立在抛光的深色大理石上、金色光线、玻璃上凝着水珠。并排看,石材、纹理和布光几乎分不出来——Mini 在背景里打了几道光束,旗舰版保持素净,差别仅此而已。
Fast 才是那个异类。它渲染出三者中最写实的大理石和最厚重的水珠,然后把瓶子平放在一边,用极端微距去拍,标签糊成一片摊在画面顶部。而它的价格是 Mini 的一倍半。
这就指向了真正决定你账单的东西:你一定会重生成镜头,而每一次重生成都要计费。 没有人能每次第一发就拿到可用的片段。这——而不是标价本身——才是便宜那档真正的理由:花掉一次旗舰版尝试的钱,Mini 给你两次尝试。
运动,以及对提示词的理解
skateboarder doing a kickflip down a set of stairs, camera following him, city street, afternoon2.0
2.0 Fast
2.0 Mini
三档都做出了看得过去的 kickflip,板和人的动作都合理。它们分道扬镳的地方是提示词描述的环境——一条城市街道,和一段楼梯。Fast 和 Mini 都找到了:Fast 给了一个带台阶和扶手的城市广场,Mini 给了一条有店铺和红绿灯、画面里带台阶的街道。旗舰版两个都没找到,把滑手放在了郊区人行道上从路缘石上蹦了一下。
不过它们也都没读懂方向。提示词说的是沿着楼梯往下做 kickflip,而 Fast 和 Mini 都让他往上走——动作对、障碍物对、方向反了。这些模型最弱的地方是提示词遵循度,而不是画面保真度,而且它并不跟着价格走:至少两个便宜档找到了那段楼梯。这也是更好的提示词写法能修好的弱点(我们的导演语言指南讲了哪些措辞是有效的)。
它们意见不合的地方
角色测试是把三档拉得最开的一条。同一个男人,单一顶光,头向左转再转回来——这个镜头同时考验转头时的身份一致性和强侧光。
A man in a green jacket stands in a parking garage under a single overhead light. He turns his head fully to the left to look at something off-camera, then turns back to face front. Same face throughout, no changes to his features. Camera static, medium shot.2.0
2.0 Fast
2.0 Mini
每一档都在转头过程中保住了那张脸。区分它们的有两点,而且指向相反的方向。
构图。 提示词写的是「中景」。旗舰版给了中景。Mini 拉远成了一个几乎看不清脸的远景——技术上是同一个场景,实际上是另一个镜头。如果你在剪一条序列、需要镜头之间能接上,这个失误就是要付代价的那种。
方向。 提示词说他把头转向左边。按句子最自然的读法,也就是这个男人自己的左边,Mini 是唯一做到的一档——旗舰版和 Fast 都把他转向了另一边。如果理解成镜头的左边,结论就反过来。无论怎么理解,三者互相之间都不一致,而且便宜那档并不是那个异类。
这里得把话说明白,因为这是差异看起来最锋利的地方:这个页面上的每一条片段都是第一次尝试。 Seedance 不会给你两次同样的镜头,所以远景而不是中景、或者头转错了方向,可能只是这一次抽卡的结果,而不是这一档的特性。任意一条重新生成,结果都可能不一样。我们展示的是每一档的一次抽卡,而不是每一档的性格——其中几条我们大概只是运气好,往两个方向都是。
时长会不会有影响?
十五秒里有个人一动不动,什么也证明不了,所以我们写了一条真的必须往前走的镜头——四个独立的节拍、一个中途改变形态的运镜、一次物件交互,以及结尾的一句台词:
A woman in a mustard-yellow jacket pushes open a glass door and walks into a sunlit coffee shop. She crosses to a window table, pulls out the chair, and sits down. She opens a laptop, types for a moment, then looks up off-camera and says: "You're late." The camera starts wide at the door, tracks with her across the room, and settles into a medium shot as she sits. Warm morning light through the window, wooden interior, other customers out of focus behind her.同一条提示词,三档,15 秒:
2.0 — 15s — $2.27
2.0 Fast — 15s — $1.82
2.0 Mini — 15s — $1.14
每一档都走完了四个节拍,并且全程保住了角色。 她进门、穿过店内、坐下、打开笔记本电脑并说出台词,在一个连续镜头里完成,$1.14 的那次生成和 $2.27 的那次一样。差别是氛围上的而不是结构上的:Fast 在整段中间推进了一层厚重的逆光雾霾,另外两档则保持通透。
有一个细节值得留意,因为正是这类东西决定一条镜头能不能用:提示词说她走向的是靠窗的桌子。在 15 秒里只有 Fast 真的把她安排在了靠窗位——旗舰版让她坐在店中央的一张桌子上,离窗户很远。
现在是同一条提示词压进 5 秒:
2.0 — 5s — $0.76
2.0 Fast — 5s — $0.61
2.0 Mini — 5s — $0.38
我们本以为短版本会损失点什么。没有哪一档漏掉节拍——尽管靠窗的桌子在三条里又有两条不见了。三档仍然让她走进来、坐下、说出台词——只是速度快了三倍。模型压缩的是节奏,而不是截断剧本。所以如果你想让一条镜头喘口气,你就得花钱买秒数,因为在更短的时间里要求同样的动作,你拿到的就是同样的动作,只是被赶着演完。
再看 10 秒这个中间地带,节奏落得刚好——而且三档终于都把她安排在了靠窗的桌子:
2.0 — 10s — $1.52
2.0 Fast — 10s — $1.21
2.0 Mini — 10s — $0.76
所以时长不会让这些模型退化——它只会让它们更贵。15 秒片段的价格几乎正好是 5 秒的 3 倍,而且你没办法从一条废掉的镜头里救出好的那一半。
秒数买到的是结构,不只是时长。一次 15 秒的生成扛下了全部四个节拍——进门、穿过、坐下、笔记本电脑——运镜在同一个镜头内从远景过渡到中景。把提示词写成分镜表,Seedance 也会在一次生成内切换不同景别,ByteDance 的指南就演示了这一点。分开生成给不了你这个:每一次都会自己选角、自己挑一家咖啡馆。
大多数人忽略的那个旋钮
回到那张价格表。2.0 在 480p 是 $0.35。Mini 在 720p 是 $0.38。 基本是同样的钱,方向相反的取舍:低分辨率的完整模型,还是高分辨率的便宜模型。
2.0 @ 480p — $0.35
2.0 Mini @ 720p — $0.38
2.0 @ 480p — $0.35
2.0 Mini @ 720p — $0.38
2.0 @ 480p — $0.35
2.0 Mini @ 720p — $0.38
那么该拧哪个旋钮?按这些证据,保住像素。三档在这些提示词里大多打平,所以从旗舰版降到 Mini 你损失不大——而从 720p 降到 480p 损失的分辨率是找不回来的,而且 TikTok 和 Reels 会把你交上去的东西再压一遍。这样一来,480p 那笔交易就没什么理由了。旗舰版确实做到了提示词里唯一明确点名的那个景别,而 Mini 拉远了——但那只是一次抽卡,不是被证明的习惯,拿它来换掉一半像素,依据太薄。
下面是这个阶梯的顶端,只有旗舰版,作为参考。1080p 的价格是同一条镜头 480p 的 5.3 倍:
2.0 @ 480p — $0.35
2.0 @ 720p — $0.76
2.0 @ 1080p — $1.89
速度:「快 2 倍」的说法是错的
你去搜 Seedance 2.0 Mini,会被告知它在质量相当的前提下比 Fast 快 2 倍。ByteDance 从来没这么说过。它自己的文档是用速度来卖 Fast 的——「兼顾成本与生成速度」——而卖 Mini 纯粹靠价格:「追求最佳性价比,请使用 Seedance 2.0 Mini。」发布时的说法同样是关于成本的,大约是 Seedance 2.0 的一半,这部分完全属实。速度那一半是别人加上去的,而且不成立。
| 档位 | 生成一条 720p 5 秒片段的耗时 |
|---|---|
| 2.0 Mini | 102s |
| 2.0 Fast | 112s |
| 2.0 | 145s |
Mini 比 Fast 快约 10%,不是 2 倍。真正的速度故事在顶端:同一条片段,旗舰版比 Mini 多花约 40% 的时间。如果你在反复迭代,这个差距累积起来远比价格差距明显。
关于价格还有一件事
这里的每个价格都是 ByteDance 自己的费率。折算成 720p 成片每秒的成本,大约是旗舰版 $0.15、Mini $0.08——和 OpenRouter 列出的旗舰版 $0.1512 是同一个数。大多数人是通过转售商而不是直连去用 Seedance 的,在你花时间去优化调用哪个变体之前,先看看他们每秒收多少更值得。我们的价格在定价页。
那到底该用哪一个?
每条提示词只生成一次,而且模型不会重复自己:请把下面的内容当成一个很强的先验,而不是一次测量。价格差异是精确的。质量差异各自都是一次掷骰子,第二次尝试可能把任何一条的排序都推翻。
默认用 Mini。 它在口播镜头和产品镜头上和旗舰版打平,在每一条长镜头里都保住了角色,还找到了旗舰版压根没去找的那段楼梯。它失手的地方——远景而不是中景、一只基本坐着不动的狗——旗舰版也在别处失手。以一半的价格,花掉一次旗舰版尝试的钱,它给你两次尝试。
需要 1080p 或 4K 时为旗舰版付费。 这是唯一一个在所有场景里都成立的优势,因为它是一项能力,而不是一次判断。在遵循提示词这件事上,它并不比便宜那档好,而且经常更差:它同时漏掉了楼梯和城市街道,在 15 秒那条里丢了靠窗的桌子,还把那个男人的头转错了方向。它还慢了大约 40%。它确实做到了提示词明确点名的那个景别,而 Mini 拉远了。那是它唯一明显领先的地方,而且只有一次抽卡——不是你能拿来做预算的习惯。
Fast 是最难说得通的一档。 它产出了整轮里最差的一条片段——侧躺着、标签糊掉的香水瓶——但也产出了仅有的两条把她安排在提示词要求的靠窗桌位上的片段。它在 15 秒那条的中间推了一层逆光雾霾,同时它也找到了那段楼梯。问题就在这种不稳定:比 Mini 贵 60%,你付的溢价买到的是一次掷硬币,而这里没有任何迹象说明这枚硬币是偏向你的。
保住分辨率,降档位,别反过来。 旗舰版在 480p 的价格和 Mini 在 720p 差不多,而且是更差的买卖:三档在这些提示词上大多打平,但 480p 就永远是 480p,上传后还要再被压一次。而按这些证据,反向的交易也没有很强的理由。
然后别读了,自己去掷骰子。 这一切底下的发现是:没有哪一档稳定胜出,这就把选择从审美问题变成了算术题——重要的是拿到你要的那条镜头需要几次尝试,再乘以每次尝试的成本。Mini 上六次尝试的花费正好等于旗舰版三次,而且你拿到的是同一份要求的六种不同解读,而不是三种。同一个模型、同一条提示词,靠窗的桌子在十秒里出现、在十五秒里消失,实际情况就长这样。
所以,拿你真正要用的提示词,在便宜那档上跑三四次,看看回来的是什么。如果其中一条就是那条镜头,那么对这条镜头来说档位问题已经有答案了。如果一条都不是,那也值得早点知道——这就是我们能告诉你的诚实边界,因为这个页面上的每一条片段都只生成了一次。
刚接触这个模型?先看如何使用 Seedance 2.0。想拿它跟别的模型比、而不是跟它自己比?那是 Seedance vs Veo vs Kling。
Pixo 提供全部三档 Seedance 的使用。价格以 ByteDance 公布的 ModelArk 费率为准,核对于 2026 年 7 月 19 日——费率会变,做预算前请自行确认。


