据動察 Beating 監測,MiniMax H3 團隊在 Reddit AMA 中透露,正在開發一款專門的圖像模型,并計劃開放權重。它會把文生圖和通用圖片編輯放進同一個模型,目前已經進入後訓練優化階段。
這款模型和 H3 來自同一套架構思路。它會沿用 H3 的 VAE Encoder,並為圖片生成單獨設計 VAE Decoder。MiniMax 設想的工作流是,先用圖像模型生成首幀,再交給 H3 繼續生成視頻。
團隊還提到,H3 本身已經表現出一定的生圖和修圖潛力。此前他們只訓練模型根據「首幀 + 文字描述」預測尾幀,沒有專門做圖片編輯訓練,但模型在多項圖片編輯評測中仍表現出強的零樣本能力。這也是 MiniMax 繼續把這套架構擴展到圖像模型的重要依據。