最近、有名なAI企業であるRunwayは、新シリーズ「インターフェースワールドモデル(Interface World Models)」の最初の画期的なモデルとなる「Solaris」を正式に発表しました。この革新システムの登場により、ソフトウェアやウェブが従来の予め記述されたコードや固定フレームワークに依存するのではなく、使用中に直接リアルタイムで、1フレームずつグラフィックインタフェースをレンダリングできるようになりました。

従来のソフトウェア開発において、デジタルインターフェースは2つの分離されたシステムに基づいて構築されてきました。「物事を知っている」AIアシスタント(大規模モデルや検索エンジンなど、テキストや画像などの静的コンテンツを提供するのが得意)と、「リアルタイムで反応する」伝統的なプログラム(ゲームエンジンやフロントエンドコードなど、動的な効果をレンダリングするのが得意ですが、あなたのタスクについては何も知らない)です。長期間にわたり、すべてのオペレーティングシステムやアプリケーション間の相互作用は、コードなどの中間表現を通じて事前に明確に定義される必要があり、視覚的な表現の豊かさが無視され、操作可能な空間が大きく「劣化」してしまいました。

image.png

Solarisの中心的な突破点は、レンダリングとインタラクションを一体化することにあります。これまでは中間コード層を介して転送する必要があったものが、単一のワールドモデルとして、各フレームを直接生成し、ユーザーの入力に対して即時かつ連続的な動的な反応をします。仮想の衣料品店を閲覧している際に、自分の写真を参考にして、現実のように自然に衣架上の服を試着することが可能になります。あるいは、簡単な音声指令によって、シーン内の机や椅子の配置や物体の色が光に合わせてリアルタイムで変化します。このようなオープンで没入感のある体験は、ソフトウェアが冷たいスクリプトの積み重ねではなく、生き生きとした場面のように感じさせます。

この革命的な技術の裏には、下位のアーキテクチャにおけるハードコアなイノベーションがあります。SolarisはRunwayのGen-4.5ビデオ生成モデルの上に構築され、速度、連続性、コスト管理の3つの側面で飛躍的な進歩を遂げました。まず、自己回帰生成メカニズムと複数ステップのノイズ除去蒸留により、通常数秒から数分かかるビデオ生成プロセスが、人間の操作のペースに追いつけるリアルタイムの動作に短縮されました。次に、大規模言語モデルとワールドモデルの協働により、大規模言語モデルがユーザーの意図を解釈し、シーンの変化を指示する一方、ワールドモデルが視覚をリアルタイムでレンダリングします。最後に、高速モデルの継続的なトレーニングにより、長時間の会話や複数ステップのインタラクションの連続性を維持しながら、推論コストを大幅に削減しています。

客観的な学術的およびユーザー評価において、Solarisは独自の優位性を示しています。マルチモーダル大規模言語モデルがスクリーンショットを使ってインターフェースを再構築する基準テストと比較した結果、従来の変換方法は視覚の複雑さが増すにつれて不可避的に詳細を失うことが判明しましたが、Solarisは最初のフレームからインターフェースの視覚的・意味的な状態を完全に保持しています。7500回以上のペア比較を含むユーザー研究では、参加者が指示に従う正確さや行動の自然さという2つの指標において、Solarisに対する好意度がそれぞれ61%と71%に達し、従来のコードベースのUI更新よりもはるかに高かったです。

もちろん、前線の革新技術として、Solarisには解決すべきいくつかの課題もあります。たとえば、高精度なリアルタイムテキスト生成はビデオ生成分野での大きな課題であり、長期間のオープンなインタラクションにおいて視覚的および意味的な一貫性を保つこともさらに改善が必要です。また、現在のスクリーンリーダーやアクセシビリティAPIなどのソフトウェアスタックとの統合も解決しなければなりません。

それでも、インターフェースワールドモデルの登場は、次世代の計算プラットフォームの進化の原型を描いています。これは、従来の「アプリケーション」の境界を完全に消滅させ、ユーザーの即時の意図に応じて個別にダイナミックに再構築するソフトウェアを実現し、私たちがデジタル世界と接続する方法を根本的に変えます。現在、Runwayは主要なパートナーに対してこのモデルのプレリリース体験申請を公開しています。

公式サイト:https://runway.com/news/research/introducing-solaris