Skip to content

建立 2026-09-15 更新 2026-09-15

第一次文字轉語音

文字轉語音(Text to Speech, TTS)是 ElevenLabs 的核心:貼稿、選聲音、按生成、下載音檔。短旁白、YouTube 口播、課程預告都從這裡開始。

最短路徑

  1. 登入後點側欄 Text to Speech
  2. 把腳本貼進文字框。第一次用兩三句就好,不要一次貼整章。
  3. 選一個聲音。可先從 Voice Library 挑「Narration」或「Conversational」類型,按預覽聽語氣。
  4. 選模型。要穩定、長篇旁白用 Multilingual v2;要情緒、對話、笑聲用 Eleven v3。
  5. 按 Generate speech,聽完不滿意再改稿或換聲音,不要先狂調參數。
  6. 下載 MP3,再丟進剪輯軟體(CapCut、FlexClip 等)對畫面。

稿子比參數重要

模型會跟著標點與換行走。句號、逗號會停頓;全大寫或引號可加重某些詞;太長的一段會聽起來趕。先把句子寫成像人在說,再考慮 模型與語氣

第一次不要克隆

聲庫裡已經有上萬種聲音。先找到接近你要的,確認流程跑得通,再考慮 聲音克隆

官方學習資源

官方 YouTube

How to make AI Voiceovers that sound Human 走完 TTS、模型與 audio tags。Pacing Sentences 示範用逗號、破折號與換行控制節奏。兩部都在 語音與克隆影音