Skip to content

建立 2026-09-15 更新 2026-09-15

模型與語氣

同一個稿、同一個聲音,換模型或改標點,聽感會差很多。先選對模型,再用稿子與少數參數微調。

模型怎麼選

模型 適合 代價
Eleven Multilingual v2 長旁白、有聲書、要穩定一致 情緒層次較少
Eleven v3 對白、笑聲、耳語、明顯情緒 較吃提示技巧,早期版本可能仍標 alpha
Flash/Turbo 即時對話、Agents、要低延遲 細節與情緒通常不如 v2/v3

v3 支援更多語言與 audio tags(音訊標籤),例如 [whispers][laughs][sarcastically]。標籤寫在稿子裡,模型才知道這句要怎麼演,而不是猜。

聽起來像人的三個旋鈕

  • Stability(穩定性):太高會平、像機器;太低會忽快忽慢。旁白常落在中間(約 40%–60%),不要一開始就拉到 90%。
  • Similarity(相似度):越高越貼近該聲音的原聲;拉滿可能破音。克隆聲音時特別明顯。
  • Style exaggeration:放大口音與個性。預設偏低較安全;廣告或角色再往上加。

多數情況:先改稿(標點、換行、音訊標籤),參數只做微調。

節奏

逗號讓句中停一下;破折號或換行讓句與句之間更長。要強調某個詞,可試引號或全大寫。官方短片 Pacing Sentences 把這幾招講完。