阿里巴巴正式推出了以真實世界爲中心的 GUI 智能體基座模型 Qwen-UI-Agent。該模型全面覆蓋了移動端、電腦端、網頁端以及深度搜索環境,旨在打破傳統模擬測試的侷限,讓模型真正具備在複雜真實設備上無縫操作的能力。

全面超越行業旗艦的綜合性能
在各項權威測試與實際環境中,Qwen-UI-Agent 展現出了強勁的實力:
- 移動端表現:在 MobileWorld 測試中斬獲82.1% 的高分,領先多個主流國際旗艦模型;而在自建的百臺真機基準 MobileWorld-Real 上,成功率高達92.2%,在 Android Daily 中更是接近滿分。
- 電腦端表現:在 OSWorld-Verified 中取得了79.5% 的成績,同時在多項任務中相比基線大幅節省了執行步數。
- 網頁與通用能力:在 WebArena 網頁測試中位列所有對比模型第一,且其通用和 Agentic 能力全面超越訓練基座模型,能夠從容應對長尾需求。
從模擬走向真實的真機環境
爲了打通“從模擬到真實”的最後一公里,Qwen-UI-Agent 搭建了覆蓋100多臺真實手機、150多個應用的真機移動環境,用於任務構建、軌跡採集及模型訓練,並推出了包含400多個任務的 MobileWorld-Real 真機基準,使研發團隊能夠根據真機成功率進行精準選型。

兼顧高效指令與安全管控
在功能特性上,該模型不僅支持常規的 GUI 界面操作,還能直接執行命令行操作,並在單次決策中以批量動作輸出,大幅縮短了執行軌跡並提升了效率。同時,它具備完善的全過程安全判斷機制:面對違法或高風險請求,它會直接拒絕並終止任務;而在涉及支付、數據刪除、隱私授權等敏感場景時,則會在關鍵步驟主動停手,等待用戶確認後再繼續。
此外,該模型支持在超過100步的超長軌跡上進行在線強化學習訓練,配合自適應課程學習,持續攻克高難度的長程任務。
項目主頁:https://tongyi-mai.github.io/Qwen-UI-Agent/
VIP會員