OpenAI 當日發佈 GPT-6 系列的最新成員——GPT-6 Sol 和 GPT-6 Luna。兩款模型採用與 GPT-6 Astra 類似的訓練方法,把 Astra 在專業工作、事實性、編碼、計算機使用和對齊等方面的最先進性能,帶入更快、更經濟的模型。OpenAI 也強調,GPT-6 Astra 仍是其整體最優秀的模型,追求無妥協體驗仍應首選它。

image.png

價格砍半,成本最低不到競品一成

GPT-6 Sol 和 Luna 的 API 價格相比 GPT-5.6 促銷價降低 50%。更值得注意的是單任務成本:在 AutomationBench 跨應用業務流程測試中,GPT-6 Sol 在 xhigh 強度下表現優於 Claude Opus 5,成本卻僅爲 Opus 5 每任務成本的 9%;同一測試 high 強度下,GPT-6 Luna 較前代提升 5.4%,每項任務成本降低 58%。

評估智能體的 Last Exam 測試中,GPT-6 Sol 在 max effort 狀態下得分 56.4%,高於 Claude Opus 5 在該評估中的最高分,每任務成本還降低 60%。事實可靠性同樣進步:GPT-6 Sol 的錯誤率約爲前代的一半,接近 Astra 級可靠性且成本更低;Luna 的事實可靠性也大幅提升。

image.png

性能逼近旗艦,長任務更省

編程方面,兩款模型均針對 AI Coding Agent 工作負載優化。FrontierCode 1.1 Main 測試中,GPT-6 Sol 較 GPT-5.6 Sol 明顯提升,並以更低成本達到 Claude Fable 5.1 xhigh 相當水平。DeepSWE v1.1 軟件工程測試裏,GPT-6 Sol 在 max effort 下取得 68.8%,距 Claude Fable 5 的最高成績 69.9% 僅差 1.1 個百分點,單任務成本卻低約 80%;GPT-6 Luna 在 max effort 下爲 66.6%,表現接近 Opus 5 與 Fable 5 的 medium effort,單任務成本分別低約 93% 和 96%。

計算機操作上,Astra 仍是 OpenAI 最強,但 Sol 和 Luna 能以更低成本完成相關任務。OSWorld 2.0 offline 測試中,GPT-6 Sol 在 xhigh effort 下取得 60.5%,與 Claude Opus 5 medium effort 的 60.3% 接近,單任務成本低約 80%;Luna 的 max effort 超過 GPT-5.6 Sol medium effort,成本約爲後者十分之一。

OpenAI 還將 Astra 改進後的溝通風格帶到 Sol 和 Luna,稱新模型在技術與編程對話中更清晰、用更少術語與奇怪措辭、壓縮低價值細節且不失實質。同時,官方改進了 GPT-6 提示緩存,默認提供更高緩存命中率,幫助智能體重用更多上下文、加快響應;價值對齊上,兩款模型較 GPT-5.6 有所改進,編碼工作的誤導性聲明發生率降低。

自今日起,GPT-6 Sol 和 Luna 已在 ChatGPT Work 與 Codex 中向所有 Plus、Pro、Business、Enterprise 和 Edu 用戶開放,免費及 Go 用戶可在桌面應用使用 Luna;API 中分別以 gpt-6-sol 與 gpt-6-luna 提供,目前尚未在 Chat 中上線。