据動察 Beating 監測,字節跳動 Seed 發布音訊創作模型 Seed Audio 1.0。它能用一條 prompt 同時生成對白、音效和環境聲,並按時間線控制聲音進場。
模型支持文本和參考音訊輸入,時間控制精度為 100ms。單次可生成約 2 分鐘音訊,還能繼續延長,並保持角色音色一致。
Seed Audio 1.0 支持 20 多種語言。同一音色可以跨語言遷移,也能切換語氣和情緒。
官方評測顯示,多數場景的音訊可用率超過 90%。大部分語言的自然度 MOS 超過 4 分。模型已上線火山方舟體驗中心,並開放 API 接入。