8 月 3 日,人工智能企業 MiniMax 正式宣佈開源其新一代通用視頻模型MiniMax H3。作爲一款全模態生成系統,該模型打破了傳統單任務的界限,能夠深度融合並理解由文本、圖像、視頻以及音頻交織而成的多模態上下文,展現出極強的任務泛化能力。

在生成規格上,H3 支持 4 到 15 秒的時長輸出,並提供 24 FPS 幀率以及 32 kHz 立體聲。用戶不僅可以根據需求選擇 21:9、16:9、4:3、1:1 等多種常見寬高比,還能通過默認將較短邊設爲 768 像素的常規模式進行基礎創作。而藉助專用的 H3-Regenerate-2K 方案,模型更能輸出高達 2K 分辨率的驚豔畫面。在多語言交互方面,它能夠穩定支持阿拉伯語、中文、英語、法德意、日韓及西葡俄等 11 種主流語言。

爲了適應多樣化的創作場景,H3 推出了靈活的模型版本與豐富的輸入規格。其中,H3-Base-FL2VA 首尾幀模式支持輸入 0 到 2 張圖像,能夠自由靈活地應對文生視頻、首幀生視頻、尾幀生視頻以及首尾幀協同生成的不同任務。而 H3-Base-Ref2VA 全模態參考模式則支持最多 9 張圖像、3 段視頻(總時長不超過 15 秒)以及 3 段音頻的混合輸入,文件總數最高可達 12 個,爲專業創作者提供了前所未有的精細控制手段。

在系統架構的底層設計上,完整的 MiniMax H3 包含三個核心模塊。首先是 H3-Context-IR(上下文中間表示),它能夠將複雜的多元指令深度剖析並轉化爲模型易於理解的結構,是保障高品質輸出的關鍵環節;其次是負責生成 768p 基礎音視頻的 H3-Base 模塊;最後則是通過將初始結果與原始上下文回傳實現 2K 超分重構的 H3-Regenerate-2K 模塊。這一組合既保留了生動的細節,又極大提升了視覺的保真度。

目前,該模型已基於 MiniMax H3 Community License 正式發佈,相關開發者與技術愛好者可以通過Hugging Face獲取完整的開源代碼與資源。業內普遍認爲,此次開源將進一步降低多模態視頻生成的應用門檻,推動影視創作、視覺設計及 AI 交互邁向全新的高度。