OpenAI近日正式發佈了最新一代超旗艦級大模型GPT-6Astra。公司總裁格雷格·布羅克曼(Greg Brockman)在媒體吹風會上給予了極高評價,甚至直言人類或許正在這一時期、通過這一模型真正邁入通用人工智能(AGI)時代。

從核心基準測試表現來看,Astra實現了多維度的代際躍遷。在數學和科學測試中,其在FrontierMath Tier4和GPQA Diamond上分別取得了97.6%和96%的優異成績;而在動手能力測試方面,在長程軟件工程DeepSWE、CAD繪製BenchCAD以及漏洞利用ExploitBench中,分別達到了74.1%、95.9%和100%的滿分或高分表現。尤其值得一提的是,在高度抽象的ARC-AGI-3測試中,Astra在特設的保留推理和壓縮上下文框架下拿到了99.9%的滿分,展現出與人類完全等同的環境推理能力。

image.png

作爲超旗艦級產品,Astra擁有105萬token的超大上下文窗口,最高輸出達12.8萬 token,知識截止時間爲2026年4月30日,並支持low、medium、high、xhigh和max五檔靈活的推理強度。不過,其價格也達到了全新高度:標準模式下,每百萬輸入token收費10美元、輸出50美元;當輸入超過27.2萬 token後,輸入和緩存價格翻倍,輸出升至75美元,同時提供雙倍收費的快速模式。在第三方獨立機構Artificial Analysis的評測中,Astra雖然在通用智能綜合指數上與部分前沿模型持平,但其Coding Agent指數高達67分,且幻覺率大幅降至51%,展現出了極高的token效率和極佳的性價比。

Astra最核心的突破在於對電腦圖形界面(GUI)的卓越操作能力。傳統AI嚴重依賴API和MCP協議來適配各類軟件,而Astra能夠直接通過屏幕、鍵盤和鼠標這套人類沿用了幾十年的通用接口,像人一樣觀察環境、理解當前狀態並準確操作。在OSWorld2.0基準測試中,Astra得分高達72.6%,平均耗時較前代縮短了約47%。無論是幾分鐘內完成貓咪寄養服務尋找、工作搜尋,還是直接在Blender中根據照片重建3D模型並轉化進UE5,或者在Excel、Power BI和各類專業軟件中處理複雜數據,Astra都能繞過繁瑣的API限制,從自然語言意圖直接直達最終結果。

image.png

在實際工程落地與應用表現上,多位內測開發者和專業機構驗證了其強大的生產力交付能力。從單次生成高還原度的Minecraft演示、瀏覽器內可運行的完整遊戲,到高效審查數萬字財務文件並精準找出人爲埋入的錯漏,Astra跨越了遊戲開發、報稅、建築渲染和財務覈對等多個截然不同的專業領域,真正實現了從零開始獨自完成複雜工作的目標。

面對不斷升級的強大模型,安全性與對齊問題也隨之備受矚目。OpenAI表示,Astra強化了對齊與指令遵循能力,並加強了隔離測試、網絡權限及模型權重保護。不過,首席科學家雅庫布·帕霍基(Jakub Pachocki)也提醒,隨着智能水平的飆升,模型可能更難被人類準確理解,甚至可能嘗試主動監控和欺騙測試系統。

目前,Astra正率先向少數可信合作企業開放,ChatGPT各級會員及API用戶也將在未來幾天陸續迎來權限推送,同時還有一個面向網絡安全機構的專屬防禦版本。隨着Astra的正式登場,AI與人類數字基礎設施的交互方式正在發生顛覆性改變。