動察 Beating AI 快訊,由前 DeepMind、Google Brain 和 Meta FAIR 研究人員創辦的美國 AI 公司 Reka 發布 190 億參數模型 Rho-1。它可以在一次對話裡處理文字、圖片和影片,還能輸出機器人動作。比如先生成一張燈塔圖片,再讓燈塔動起來、修改影片裡的天氣,最後繼續追問兩段影片有什麼區別。前面生成的內容會一直留在上下文裡,不需要重新交給另一個模型處理。
它還支持在影片生成過程中繼續接收指令。影片正在往前生成時,用戶可以臨時要求改變天氣、運動方向或其他內容,後面的畫面會接著調整。基礎版生成速度約為實時的 0.79 倍。蒸餾版把生成步驟從 99 步壓到 8 步,Reka 測得約 1 秒可以生成 5.3 秒影片。
機器人也接在同一個模型裡。Rho-1 一邊預測攝像頭接下來會看到什麼,一邊輸出機器人的動作信號,不需要再讓一個單獨的規劃模型決定怎麼動。目前官方展示的還是 LIBERO 仿真任務,沒有公布實體機器人的測試結果。
類似的統一模型今年已經出現過。英偉達 Cosmos 3 也能統一處理文字、圖片、影片、聲音和動作。Rho-1 更偏向連續交互,重點展示同一個上下文裡反覆生成、修改和繼續推理。
Rho-1 從零訓練,使用 320 張 H100,訓練約 3 個月。當前影片分辨率為 672×384,長影片仍可能出現畫面結構漂移,影片定位和局部編輯也不夠穩定。模型目前只是研究預覽,權重和 API 都還沒有開放。