動察 Beating AI 快訊,騰訊混元開源 15 億參數語音生成與編輯模型 AuK,官方直接稱它為「音頻版 Nano Banana」。聲音克隆、改詞、換情緒、去口音、調語速和音高、降噪、多人及音樂分離,都塞進了同一個模型,用自然語言就能控制。
AuK 可以直接改已有錄音。說錯幾個字,只改那幾個字就行,不用整段重錄;內容不變,也能換情緒、音色或口音。改歌詞、去掉笑聲和咳嗽聲、把正常說話改成耳語也都支持。聲音克隆也不用先給參考錄音配文字稿,只要一段聲音和新的文本就能生成。
官方測試中,AuK 在語音生成和通用語音編輯多項評測領先。SpeechEditBench 得分 49.73,第二名 Ming-UniAudio 為 28.70。快速版 AuK-Flash 經過蒸餾後只需 4 步推理,速度約快 4.5 倍。不過論文也承認,AuK 目前還不能穩定理解所有隨意輸入的自然語言指令,仍要靠 Prompt Enhancer 先判斷任務、整理參數和改寫指令。代碼和模型權重已經公開,採用 MIT 許可證。