動察 Beating AI 快訊,ElevenLabs 發布新一代語音模型 Eleven v4 和實時版 Eleven v4 Turbo。v4 主打更自然的情緒和聲音控制,Turbo 面向實時語音 Agent,中位推理延遲約 100ms。
在 Artificial Analysis 最新 TTS 盲測榜中,Eleven v4 目前以 1315 Elo 排第一。Cartesia Sonic 3.6 為 1275,Gemini 3.8 Flash TTS 為 1267,Qwen-Audio-3.0-TTS-Plus 為 1258。上一代 Eleven v3 目前只有 1169,排第 17。
v3 已經支持笑聲、耳語等音頻標籤,v4 主要把這套控制做得更準。用戶可以直接指定語氣、節奏、情緒和音效,也可以用自然語言描述一句話該怎麼說。模型還把語言覆蓋從 70 多種擴到 90 多種,Instant Voice Clone 只需要約 10 秒音頻,並增強了長文本和多人對話中的聲音一致性。
Turbo 則專門解決實時對話的速度問題。官方文檔顯示,v3 Conversational 的中位推理延遲約為 280ms,v4 Turbo 降到約 100ms。