アリババは8月20日に、新たなGUIスマートエージェントベースモデル「Qwen-UI-Agent」を正式に発表しました。このモデルはモバイル端末、コンピュータ、ウェブサイト、そして深層検索(DeepSearch)環境をすべてカバーし、複数の主要なグラフィカルユーザーインターフェースのベンチマークテストで業界の主要なモデルと同等以上に達しています。
具体的なベンチマークでのパフォーマンスにおいて、Qwen-UI-Agentはモバイル端末で強力な実力を示しています。MobileWorldベンチマークでは82.1%のスコアを獲得し、GPT-5.6SolおよびClaude Opus4.8よりもそれぞれ12.0%と14.6%高い成績を収めています。また、リアルな環境用のベンチマークであるMobileWorld-Realでは92.2%という結果を出し、Gemini3.1Pro、Claude Opus4.8、GPT-5.6Solを上回りました。AndroidDailyベンチマークでは97.5%に達し、満点に近い成績を収めました。コンピュータやブラウザ側では、OSWorld-Verifiedで79.5%を記録し、GPT-5.5およびGemini3.1Proを上回りました。WebArenaでも73.6%のスコアを出し、比較モデルの中で最高位を記録しました。さらに、GUI GroundingのScreenSpot-Proテストで81.5%のスコアを獲得し、他の4つのベンチマークでSOTA記録を更新しました。

シミュレーションから現実への実装の難題を克服するために、Qwen-UI-Agentは100台以上の本物のスマートフォンと150種類以上のアプリケーションをカバーする真機モバイル環境を構築しました。この環境は、タスクの構築、軌跡の収集、モデルのトレーニングと評価に使用され、400以上のタスクと100以上のアプリケーションを含むMobileWorld-Realの真機ベンチマークを独自に構築しました。通常のGUIクリック操作だけでなく、コマンドライン操作を直接実行することも可能です。また、単一の決定で複数のアクションを一括して出力し、コンピュータタスクにおけるCLIアクションの割合はほぼ半数であり、約40%のアクションが一括形式で出力されています。

VIP会員