グーグルのDeepMindチームは最近、新たなGenCeptionモデルをリリースしました。このモデルは従来の動画生成AIを逆に使い、現実世界を深く理解できる視覚分析エンジンに変革しようとしています。これまでのセグメンテーションや深度推定などのタスクがそれぞれ独立していたのとは異なり、GenCeptionは単一のモデルで効率的に深度推定、画像セグメンテーション、3D姿勢推定などの5つの主要なビジュアルタスクを同時に処理できます。

image.png

このモデルはアリババがオープンソースした通義万相Wan2.1フレームワークに基づいてトレーニングされています。一度の前方伝播で予測が完了し、処理速度が大幅に向上しています。ユーザーはシンプルなテキストのヒントを入力するだけで、モデルは深度マップ、セグメンテーションマスク、カメラの動きの軌跡などの豊富な情報を正確に出力します。

一人の合成データでのトレーニング、驚くべき一般化性と髪の毛一本の細部まで保持

面白いことに、GenCeptionのトレーニングデータセットには約7,500本のBlenderでレンダリングされた単人合成動画しか含まれていません。しかし、このモデルは非常に強い一般化能力を示しており、リアルワールドの多人数動画をスムーズに処理でき、動物やロボットなどのカテゴリにも簡単に移行できます。

実際のテストでは、小規模なモデルで81フレームの動画を約6秒で処理し、140億パラメータの大きなモデルでも約10秒で処理できます。その詳細な再現度は訓練用の合成元画像をも上回り、猫のひげや一本一本の髪の毛の端まで明確に保持されています。