OpenAI 今日正式發佈了 GPT-6系列的最新成員 ——GPT-6Sol 與 GPT-6Luna。這兩款新模型採用了與 GPT-6Astra 類似的方法進行訓練,旨在將 Astra 在專業工作、事實性、編程、計算機使用及對齊等方面的頂尖性能,帶入速度更快、更經濟的小尺寸模型中。官方表示,雖然 GPT-6Astra 依然是追求最佳效果和無妥協體驗的首選,但 Sol 與 Luna 在大幅降低成本的同時,展現出了極其強悍的綜合競爭力。
在價格方面,GPT-6Sol 和 Luna 模型的 API 價格相比 GPT-5.6的促銷價直接降低了50%。此外,OpenAI 還針對基於 GPT-6的開發者優化了提示緩存,默認提供更高的緩存命中率,幫助智能體重用更多上下文,從而實現更快的響應並進一步節省費用。

在覈心性能表現上:
業務流程與智能體表現:在 AutomationBench 跨應用業務流程測試中,GPT-6Sol 在高強度下表現優於 Claude Opus5,且成本僅爲其每任務成本的9%;在 Last Exam 智能體評估中,GPT-6Sol 的得分超越了 Claude Opus5的最高分,同時每任務成本降低60%。
事實可靠性:在去標識化的真實世界對話中,GPT-6Sol 的錯誤率約爲前代的一半,接近 Astra 級的可靠性,Luna 的事實可靠性也迎來了大幅提升。

編程與軟件工程:兩款模型均針對 AI Coding Agent 工作負載進行了深度優化。在 DeepSWE v1.1軟件工程測試中,GPT-6Sol 取得68.8% 的成績,距離最高成績僅差1.1個百分點,單任務成本卻低約80%;Luna 的表現也逼近部分競品的中檔強度,成本更具優勢。
計算機操作能力:在 OSWorld2.0離線測試中,GPT-6Sol 取得了接近競品中檔強度的成績,單任務成本約低80%,而 Luna 的成績也超過了上一代主打型號,成本僅爲後者的十分之一。
除了硬核性能的提升,OpenAI 還將 GPT-6Astra 改進後的溝通風格賦予了 Sol 和 Luna,使新模型在技術和編程對話中更加清晰、簡練,大幅減少了術語堆砌和低價值細節。在價值對齊方面,兩款模型均較 GPT-5.6版本有所改進,例如編碼工作中的誤導性聲明發生率明顯降低。
目前,GPT-6Sol 和 GPT-6Luna 已在 ChatGPT Work 和 Codex 中向所有 Plus、Pro、Business、Enterprise 和 Edu 用戶全面開放,免費用戶和 Go 用戶也能夠在桌面應用中使用 GPT-6Luna。在 OpenAI API 中,它們分別以 gpt-6-sol 和 gpt-6-luna 的形式提供服務。
VIP會員