今日,AI公司MiniMax正式發佈通用全模態生成模型MiniMax H3。該模型首次實現了文本、圖像、視頻、音頻的統一理解與生成,打破了長期以來視頻生成領域各任務、各模態相互割裂的局面,標誌着多模態生成模型從"專用專家"向"通用助手"邁出關鍵一步。
據官方介紹,H3支持原生雙聲道音視頻輸出,最高可生成15秒2K分辨率內容。在前期邀測中,H3在指令遵循、品牌信息呈現、V2V動作遷移等場景下表現出商用級穩定性,已可應用於廣告、電商、遊戲、UI設計等多個商業領域。

技術層面,H3引入了Contextual Omni Representation(上下文全模態表示)技術,使自然語言成爲連接各類模態的通用橋樑。用戶只需用語言描述複雜關係——例如"參考某段視頻的希區柯克式鏡頭運動,讓指定圖片中的人物唱出某段音頻的歌聲"——模型即可自動完成全鏈路理解與生成。配合自研的H3-VAE與In-context Regeneration技術,H3在2K分辨率下的每秒生成成本不到主流模型的1/3,768P分辨率下不到1/2,爲行業提供了目前已知的最優性價比方案。
值得關注的是,MiniMax宣佈將在未來幾天內,在符合相關法律法規的前提下開源H3模型權重。這也是國產視頻生成大模型首次面向社區開放權重,旨在推動開源生態建設並加速國產芯片適配。H3在設計初期就考慮了多款國產芯片的兼容性,其開源將進一步降低國內企業在多模態AI應用上的技術門檻。
MiniMax方面表示,H3目前仍存在畫面精細度和模型規模上的提升空間,後續將推進H系列與M系列模型能力的融合,並通過Scaling持續擴展模型上限。
業內分析認爲,H3的發佈與開源或將改變閉源模型長期主導視頻生成領域的格局,爲多模態AI的普惠化應用按下加速鍵。
