在當前的大模型浪潮中,視頻生成模型常常被視爲通往具身智能的未來模擬器。然而,主流模型多采用像素空間的直接預測,容易在物理規律的穩定性和連貫性上出現偏差。針對這一行業痛點,研究團隊近日正式推出了全新的物理世界模型PhiZero。該模型摒棄了傳統的盲目預測套路,創新性地引入了“物理語言”概念,讓AI在生成視頻前先進行顯式的物理推理。
作爲核心創新,PhiZero提出了一種被稱爲“物理語言”的離散表徵。該語言通過自監督學習方式,從海量野外視頻中提煉出狀態轉移模式,捕捉不同視覺經驗裏的動態演化規律。在此基礎上,模型構建了“先推理、後渲染”的創新架構:系統首先在物理語言空間內自迴歸地推斷未來世界的演變軌跡,隨後交由專用的擴散解碼器將其渲染爲高清視頻。這種設計不僅將底層動力學推演與像素級合成分離開來,還大幅提升了模型在物理一致性上的表現。

在技術實現上,該系統分爲分詞器與推理器兩大核心模塊。其中,物理語言分詞器利用轉移級 Q-Former 捕獲相鄰狀態變化,並結合有限標量量化機制生成緊湊的離散符號;擴散解碼器則以首幀和離散符號爲條件,恢復出細膩的視覺細節。而物理語言推理器則基於預訓練視覺語言模型進行初始化,從首幀和文本動作意圖出發,精準預測未來的物理語言序列。

多項基準測試結果表明,PhiZero在 Physics-IQ Verified、PhyGround 以及 WorldModelBench 等多個物理推理和視頻生成評估中取得了領先成績。無論是碰撞引起的物體位移、重力驅動的形變,還是複雜的連鎖反應,模型均能展現出高度逼真的物理合理性。
隨着具身智能與機器人技術的加速落地,PhiZero的問世爲可控、可交互的世界建模開闢了全新路徑,有望在長時程模擬與運動遷移等場景中發揮關鍵作用。