header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

「StepAudio」宣布推出StepAudio 2.5 Realtime:主觀體驗評分高出 GPT-Realtime-1.5 近18%,每小時通話價格為 3.8 美元

据動察 Beating 監測,階躍星辰發布端到端實時語音大模型 StepAudio 2.5 Realtime,主打「活人感」對話,支援全維度人設自定義和副語言(語調、停頓、歎息等非語言信號)感知。模型已全量上線開放平台 API。

官方給出的五個評測維度(2026 年 4 月測試)全部拿下第一。其中最能反映真實體驗的主觀評測(手機 APP 真人對話打分)得 80.41,GPT-Realtime-1.5 為 68.01,Gemini Live 為 67.16。語音問答基準得 79.80,是 GPT-Realtime-1.5(53.20)的近 1.5 倍。副語言理解 82.18,通用對話 86.36,車載場景 84.80。

技術路線有三個關鍵設計。一是基於 1 萬餘個原生人設,通過算法裂變出百萬級人設特徵矩陣,融合大量真實對話語料訓練,讓模型在長尾小眾話題上也能保持穩定。二是針對角色扮演場景做了專屬 RLHF(基於人類反饋的強化學習)對齊,解決 AI 聊著聊著「人設崩塌」的老問題。三是理解與生成深度融合,繼承自家 StepAudio 2.5 TTS 的表現力,做到全局場景定調和句內細節雕琢。

API 兼容 OpenAI Realtime API 協議(基於 WebSocket),開發者可低成本遷移。定價為輸入 10 元/百萬 token(快取命中 2 元),輸出 70 元/百萬 token,官方估算連續語音通話成本約 3.8 元/小時。

举报 糾錯/舉報
糾錯/舉報
提交
新增文庫
僅自己可見
公開
保存
選擇文庫
新增文庫
取消
完成