Google DeepMindは最近、新しいモデル「GenCeption」を発表しました。このモデルは、事前学習された動画生成モデルを基盤としており、深度推定や画像セグメンテーション、3D姿勢推定などの古典的なコンピュータビジョンのタスクを解決するために設計されています。複数のベンチマークテストで現在の最先端レベルに近いまたはそれを上回る性能を達成しています。注目すべき点は、GenCeptionが必要なトレーニングデータの規模が従来の専用視覚モデルよりもはるかに小さいということです。

現在のコンピュータビジョン分野では、タスクに特化したモデルが主流であり、例えばセグメンテーションに使われるSegment Anythingや深度推定に使われるDepth Anythingなど、異なるタスクごとに別々のアーキテクチャが使われています。DeepMindの研究チームは、大規模なテキストから動画へのモデルがトレーニング中にシーンの空間構造や物体の運動法則、および言語と視覚の関連性を学習しており、汎用的な視覚基礎モデルになる可能性があると考えています。

QQ20260720-091824.jpg

GenCeptionはアリババがオープンソースで公開している動画モデルWan2.1に基づいて開発され、アーキテクチャを簡略化することで一度のフォワードプロパゲーションで視覚タスクの予測を行うことができます。このモデルはテキストのヒントに基づき、同じ動画から深度マップ、表面ノーマル、セグメンテーションマスク、および姿勢推定結果を生成し、トレーニング可能なモジュールにより3Dのキーポイントなどの非画像出力タスクもサポートします。

トレーニングデータに関しては、GenCeptionは7,500本の動画を含む合成データセットを使用しています。これは800人の人体モデルと200のアクションシーケンスを組み合わせてBlenderでレンダリングして生成されました。研究結果によると、このモデルは深度推定、表面ノーマル予測、3D姿勢認識、および言語誘導型セグメンテーションなどのタスクにおいて優れた性能を示しており、トレーニングデータ量は一部の既存モデルの七分の一から五百分の一に過ぎません。

さらに、GenCeptionは強力な汎化能力を備えています。トレーニングデータは主に単一の人物の合成人体動画から構成されているにもかかわらず、モデルは現実世界の多人物シーン、動物、人形ロボットなどの見慣れないカテゴリを処理でき、詳細な視覚的予測結果を生成することができます。

ただし、研究チームはいくつかの複雑なタスクにおいて複数のタスクを統合してトレーニングすることによって性能が低下する可能性があることを指摘しています。また、モデルの推論速度は今後改善が必要です。現在では、81フレームの動画を処理するのに約6〜10秒かかります。