動察 Beating AI 快訊,Meta 把視覺分割模型 SAM 3.1 正式接入 Model API。開發者傳入圖片或影片,再輸入「紅色自行車」之類的短語,就能直接找出對應物體,返回邊界框和像素級蒙版。影片裡還能一路追蹤同一個目標,方便自動打碼、加特效等。
Meta 今年 3 月已經發布開放權重版本的 SAM 3.1。相比 SAM 3,它最大的升級是 Object Multiplex,以前多個目標要逐個處理,現在一次最多可以同時處理 16 個。Meta 測試中,一張 H100 處理多目標影片的速度從每秒 16 幀提高到 32 幀;追蹤 128 個目標時,速度約為 SAM 3 的 7 倍。
以前開發者需要自己下載權重、準備 GPU 和部署環境,現在可以直接走 Meta 託管的 API。圖片分割每 1000 張收費 2.5 美元,影片每 1000 幀收費 0.2 美元,還可以直接用 OpenAI SDK 接入。
不過 API 版目前只接受文字提示,開放權重版還能用框、點等視覺提示來指定目標。影片 API 每幀最多追蹤 16 個物體。