多鏡頭與原生音訊
VIDEO 3.0 把「AI 導演」做成兩件事:一段裡可切最多約 6 個鏡頭,以及可選擇輸出同步的對白、音效、環境音。這是 3.0 相對 2.6 最有感的升級。
官方說明:VIDEO 3.0 指南、VIDEO 3.0 Omni 指南。
多鏡頭(Multi-Shot)
先打開 Multi-Shot,才能再用 Custom Multi-Shot。關掉時就是傳統單鏡頭。
| 模式 | 你要做的事 | 模型做的事 |
|---|---|---|
| Multi-Shot(智慧) | 寫一整段故事提示詞 | 自動切景別、補轉場 |
| Custom Multi-Shot | 每個 shot 各自寫提示詞與秒數 | 嚴格照你的分鏡走 |
限制與習慣:
- 單次最長約 15 秒;各鏡頭秒數加總必須等於總時長。
- 每個鏡頭提示詞不宜過長(實務上常見上限約 512 字元,以介面為準)。
- 可加首幀,一般不要加尾幀。
- 角色要穩,搭配 元素。
每個 shot 建議寫:景別、主體、動作、運鏡、若有對白就寫台詞。範例結構見 提示詞。
Magnific Academy 有清楚的逐步片:Kling 3.0 Multi Shot Mode。
原生音訊(Native Audio)
打開後,模型一併生成聲音,而不是無聲畫面再對口型。適合:
- 提示詞裡寫對白(中、英、日、韓、西,以及部分口音/方言)
- 寫環境音與動作音(蒸汽、雨、人群)
- 角色元素已綁音色時,讓同一個人在不同鏡頭聲音一致
代價是積分較高。畫面還沒對時先關音訊;口型與台詞定了再開。官方舉例(數字以官網為準):數秒 1080p 加原生音訊,會比無聲、720p 貴一截。
Omni 可把音色綁在元素上,讓角色「看起來一樣、聽起來也一樣」。