abc小站

2026-08-31

Kling VIDEO 3.0:一次出多镜,声音跟着出

以前生成视频,常是一段无声短镜头,对白、转场、角色长相各管各的。可灵把 VIDEO 2.6 升到 3.0 之后,官方指南把重点写在三件事上:多镜头、原声音频、把主体锁住。最长 15 秒。

对照表很清楚。文生视频、图生视频、首尾帧,2.6 就有。3.0 新加的是:Multi-Shot、首帧加元素参考、三个以上角色对白指认、中英日韩西以及方言口音、15 秒、时长可调。VIDEO O1 这条线升成 3.0 Omni,官方说法是控制和叙事更强。

先开 Multi-Shot

输入区打开 Multi-Shot。模型按提示词自己排转场、景别、机位。场景其实只适合一镜时,它也可以收回去,改成单镜头。关掉这个开关,就固定单镜。

要自己卡每一镜,先开 Multi-Shot,再点 Custom Multi-Shot。这时可以写镜头数量和每镜时长。官方示例是分镜语言:Shot 1 侧面、Shot 2 正面微距、Shot 3 手、Shot 4 副驾上的旧照片。摩托车雪地那条示例排到了六镜。

提示词里把对白写进人名后面。3.0 会按人配声,减少「一张画面里好几个人,不知道谁在说话」。官方给的家庭客厅例子,是妈妈、爸爸、男孩、女孩各一句,还写了语气。比 2.6 更适合三个人以上同框。

锁主体,再出声

图生视频可以绑元素。上传起始帧之后,走「绑定主体以增强一致性」。变焦、摇镜、俯仰时,人、物、场景不容易漂。元素有两种做法:上传或录一段角色视频,抽出外形和原声(录制官方写明在 App 里);或者传 2 到 4 张参考图,角色类还可以再绑音色。主体创建时已经绑过声音,提示词里就别再指定一遍。

原声音频支持中、英、日、韩、西。可以在同一段里换语言。不在这五种里的对白,模型会译成英语。中文方言官方点了东北、北京、台湾、粤语、四川等;英语口音点了美式、英式、印度等。在句子前标方言即可。粤语那条示例还夹了英文词,当口语写进去。

画面上的字,3.0 按官方说法能保住原图里的招牌、字幕、logo,也能新写。电商、包装这种要看清字母的,比以前有用。时长 3 到 15 秒可调。15 秒够一条小动作或一场短对话走完,不用先切成三四段再拼。官方 15 秒长镜头示例是按秒写调度:第 4 秒加速、第 8 秒切近景、第 12 秒高潮。写时长锚点,比只写气氛更听得懂。

按秒扣积分

两种模式:Native Audio 和 No Native Audio,分辨率 1080p / 720p。带原声还可以再开 Voice Control。官方标价是:

例子:5 秒、原声、1080p 是 60 积分;5 秒、无原声、720p 是 30 积分;5 秒、原声加音色控制、1080p 是 70 积分。先按秒估,再决定要不要声。

动手顺序可以很短:写清场次和对白 → 开 Multi-Shot(要控镜再开 Custom)→ 有固定角色就绑元素 → 选时长和分辨率 → 决定要不要原声。第一次用,先 5 秒、单人或双人对白,比一上来写十五秒群戏容易看出模型听没听懂分镜。

材料来自可灵官方《Kling VIDEO 3.0 Model User Guide》。能力对照、分镜开关、语言列表、积分示例都按该页。第三方站点写的 4K、每秒美元价,本文没用。