圖生影片
圖生影片(Image-to-Video)上傳一張圖當首幀,再寫這張圖接下來怎麼動。構圖、角色臉、服裝、色調已經在圖裡,提示詞就專心寫動作與鏡頭,不要把場景再描述一遍。
這是做角色一致、商品展示、把 AI 靜態圖「拍活」時最穩的一條路。
最短操作
- 選 VIDEO 3.0,切到圖生(或在文生介面上傳 Start Frame)。
- 上傳一張主體清楚、不要過度裁切臉的圖。寬高至少數百像素,常見 jpg/png。
- 提示詞用官方公式:主體+動作(背景若也要動,再寫背景+動作)。
- 需要角色跨鏡頭不變時,綁定 元素。
- 選時長與比例;比例盡量接近原圖,減少變形。
- 生成後看三件事:臉有沒有壞、動作合不合理、背景有沒有漂。
官方說明:Image-to-Video Guide。VIDEO 3.0 還支援「首幀+元素參考」,見 VIDEO 3.0 指南。
提示詞跟文生差在哪
圖已經告訴模型「長什麼樣子、在哪裡」。你只要告訴它接下來幾秒發生什麼:
女子緩緩轉頭看向鏡頭,髮絲被風吹起。攝影機極慢向前推。咖啡蒸氣持續上升。
不要再寫「一位穿紅裙的女子站在公寓窗邊……」除非你想讓模型改掉原圖。描述與圖差太多,容易出現扭曲或主體換成別人。
多個主體就依序列出:「貓跳上桌,男子伸手去抱」。
選圖原則
- 主體完整、沒被遮太兇,臉不要過暗或過曝。
- 動作要「圖裡看起來做得到」。坐著的人突然跑步,模型會硬編,四肢容易壞。
- 文字、Logo 想保留時,VIDEO 3.0 對大字比較穩;小字仍可能閃爍。