現在の大規模モデルの波において、ビデオ生成モデルはしばしば身体知能への未来のシミュレーターと見なされている。しかし、主流モデルは多くがピクセル空間での直接的な予測を採用しており、物理法則の安定性や一貫性に問題が生じやすい。この業界の課題に対応するため、研究チームは最近、新しい物理世界モデル「PhiZero」を正式に発表した。このモデルは従来の無作為な予測方法を放棄し、画期的に「物理言語」という概念を導入し、AIがビデオを生成する前に明示的な物理的推論を行うようにしている。

このモデルの中心的な革新点として、PhiZeroは、「物理言語」と呼ばれる離散表現を提案している。この言語は自己教師あり学習を通じて大量の野外動画から状態遷移パターンを抽出し、異なる視覚経験におけるダイナミックな進化の法則を捉えている。これに基づき、モデルは「まず推論してからレンダリングする」画期的なアーキテクチャを構築した。システムはまず物理言語空間内で自己回帰的に未来の世界の進化の軌跡を推定し、その後専用の拡散デコーダーにその結果を渡して高精細なビデオに変換する。このような設計により、下位の動力学の推論とピクセルレベルの合成を分離し、モデルの物理的一貫性の性能を大幅に向上させている。

image.png

技術実装において、このシステムはトークン化器と推論器という2つの主要モジュールから構成されている。そのうち物理言語トークン化器は、転移級Q-Formerを使用して隣接する状態の変化を捉え、有限スカラー量子化メカニズムによってコンパクトな離散記号を生成する。一方、拡散デコーダーは最初のフレームと離散記号を条件として、詳細な視覚的ディテールを再現する。そして物理言語推論器は、事前学習された視覚言語モデルで初期化され、最初のフレームとテキストの動作意図をもとに、正確に未来の物理言語シーケンスを予測する。

image.png

多数の基準テストの結果表明、PhiZeroはPhysics-IQ Verified、PhyGroundおよびWorldModelBenchなどの物理的推論とビデオ生成評価で優れた成績を収めている。物体の衝突による位置ずれ、重力による変形、あるいは複雑な連鎖反応など、あらゆるケースにおいて高い現実的な物理的合理性を示している。

具身知能とロボット技術の急速な実用化が進む中、PhiZeroの登場により、制御可能で相互作用可能な世界モデリングの新たな道を開いた。長時間にわたるシミュレーションや運動移行などのシナリオで重要な役割を果たすことが期待されている。