header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

谷歌最強語音轉錄模型來了:準確率進前五,但還沒打過 ElevenLabs

動察 Beating AI 快訊,Google 發布 Gemini 3.5 Transcribe,這是目前最準確的 Google 語音轉錄模型,也是 Google 首次在專用轉錄模型中加入 Smart 模式。模型分實時和錄音轉錄兩版,目前已開放 Gemini API 公測。Artificial Analysis 評測中,非流式 WER(詞錯誤率,越低越好)為 2.6%,實時版為 4.0%。最終轉錄延遲相比上一代 Chirp 3 縮短 70%。


Smart 模式不再只是把聲音逐字變成文字。比如你說「週二開會,不,週三」,它會直接留下「週三」;「嗯、啊」等口頭禪也會自動刪除,還能把口語整理成段落、列表、日期和數字。需要會議記錄原話時,也可以繼續使用默認的逐字轉錄模式。


模型支持 85 種以上語言和中途切換語言,還能加入自定義專業詞彙。錄音轉錄約每分鐘 0.005 美元,也就是每 1000 分鐘 5 美元;實時版約每分鐘 0.009 美元。獨立榜單上,它比 OpenAI GPT Transcribe 的 3.3% 更準,但還沒超過 ElevenLabs Scribe v2:後者 WER 為 2.2%,每 1000 分鐘約 3.67 美元。


這套模型已經用於 Android 的 Rambler 和 macOS 版 Gemini,接下來還會進入 Chrome。屆時可以直接在網頁輸入框裡說話打字。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成