模型與語氣
同一個稿、同一個聲音,換模型或改標點,聽感會差很多。先選對模型,再用稿子與少數參數微調。
模型怎麼選
| 模型 | 適合 | 代價 |
|---|---|---|
| Eleven Multilingual v2 | 長旁白、有聲書、要穩定一致 | 情緒層次較少 |
| Eleven v3 | 對白、笑聲、耳語、明顯情緒 | 較吃提示技巧,早期版本可能仍標 alpha |
| Flash/Turbo | 即時對話、Agents、要低延遲 | 細節與情緒通常不如 v2/v3 |
v3 支援更多語言與 audio tags(音訊標籤),例如 [whispers]、[laughs]、[sarcastically]。標籤寫在稿子裡,模型才知道這句要怎麼演,而不是猜。
聽起來像人的三個旋鈕
- Stability(穩定性):太高會平、像機器;太低會忽快忽慢。旁白常落在中間(約 40%–60%),不要一開始就拉到 90%。
- Similarity(相似度):越高越貼近該聲音的原聲;拉滿可能破音。克隆聲音時特別明顯。
- Style exaggeration:放大口音與個性。預設偏低較安全;廣告或角色再往上加。
多數情況:先改稿(標點、換行、音訊標籤),參數只做微調。
節奏
逗號讓句中停一下;破折號或換行讓句與句之間更長。要強調某個詞,可試引號或全大寫。官方短片 Pacing Sentences 把這幾招講完。