第一次文字轉語音
文字轉語音(Text to Speech, TTS)是 ElevenLabs 的核心:貼稿、選聲音、按生成、下載音檔。短旁白、YouTube 口播、課程預告都從這裡開始。
最短路徑
- 登入後點側欄 Text to Speech。
- 把腳本貼進文字框。第一次用兩三句就好,不要一次貼整章。
- 選一個聲音。可先從 Voice Library 挑「Narration」或「Conversational」類型,按預覽聽語氣。
- 選模型。要穩定、長篇旁白用 Multilingual v2;要情緒、對話、笑聲用 Eleven v3。
- 按 Generate speech,聽完不滿意再改稿或換聲音,不要先狂調參數。
- 下載 MP3,再丟進剪輯軟體(CapCut、FlexClip 等)對畫面。
稿子比參數重要
模型會跟著標點與換行走。句號、逗號會停頓;全大寫或引號可加重某些詞;太長的一段會聽起來趕。先把句子寫成像人在說,再考慮 模型與語氣。
第一次不要克隆
聲庫裡已經有上萬種聲音。先找到接近你要的,確認流程跑得通,再考慮 聲音克隆。
官方學習資源
官方 YouTube
How to make AI Voiceovers that sound Human 走完 TTS、模型與 audio tags。Pacing Sentences 示範用逗號、破折號與換行控制節奏。兩部都在 語音與克隆影音。