Skip to content

建立 2026-09-15 更新 2026-09-15

多鏡頭與原生音訊

VIDEO 3.0 把「AI 導演」做成兩件事:一段裡可切最多約 6 個鏡頭,以及可選擇輸出同步的對白、音效、環境音。這是 3.0 相對 2.6 最有感的升級。

官方說明:VIDEO 3.0 指南VIDEO 3.0 Omni 指南

多鏡頭(Multi-Shot)

先打開 Multi-Shot,才能再用 Custom Multi-Shot。關掉時就是傳統單鏡頭。

模式 你要做的事 模型做的事
Multi-Shot(智慧) 寫一整段故事提示詞 自動切景別、補轉場
Custom Multi-Shot 每個 shot 各自寫提示詞與秒數 嚴格照你的分鏡走

限制與習慣:

  • 單次最長約 15 秒;各鏡頭秒數加總必須等於總時長。
  • 每個鏡頭提示詞不宜過長(實務上常見上限約 512 字元,以介面為準)。
  • 可加首幀,一般不要加尾幀
  • 角色要穩,搭配 元素

每個 shot 建議寫:景別、主體、動作、運鏡、若有對白就寫台詞。範例結構見 提示詞

Magnific Academy 有清楚的逐步片:Kling 3.0 Multi Shot Mode

原生音訊(Native Audio)

打開後,模型一併生成聲音,而不是無聲畫面再對口型。適合:

  • 提示詞裡寫對白(中、英、日、韓、西,以及部分口音/方言)
  • 寫環境音與動作音(蒸汽、雨、人群)
  • 角色元素已綁音色時,讓同一個人在不同鏡頭聲音一致

代價是積分較高。畫面還沒對時先關音訊;口型與台詞定了再開。官方舉例(數字以官網為準):數秒 1080p 加原生音訊,會比無聲、720p 貴一截。

Omni 可把音色綁在元素上,讓角色「看起來一樣、聽起來也一樣」。

相關資料