開放人工智能巨頭OpenAI於當地時間 9 月 3 日正式發佈了全新的GPT-6 Astra模型公告,然而其發佈過程卻波折不斷。公告剛剛上線便遭遇撤下,頁面長時間陷入無法正常訪問的狀態。起初,官方將此次意外歸咎於內容管理系統故障以及互聯網中斷,並極力澄清撤稿行動與任何基準測試成績絕無關聯。

然而,隨着博客內容的重新上線及後續更新,外界發現該模型的各項評測數據經歷了多次反覆調整。其中最具爭議的是,Astra的幻覺率數值率先從4.2%大幅下調至2%,隨後又戲劇性地調回了最初的4.2%。不僅如此,GPT-5.6 Sol的幻覺率、內部網絡安全評測等關鍵成績也相繼出現變動。值得注意的是,不僅是OpenAI自身產品,競爭對手Anthropic旗下部分模型的成績也出現了先下調後回升的現象,甚至部分數據的調整時間早於官方首次發佈博客之前。

面對外界的諸多猜測與不解,OpenAI官方解釋稱,這一系列調整的唯一目的是確保相關數據能夠作爲模型可用性能的最佳真實估計,且諸如測試條件等客觀因素均會對最終結果產生影響。儘管如此,這番頻繁的數據更迭依然引發了廣大AI專家對其涉嫌“刷榜”的強烈質疑,同時也徹底暴露了整個AI行業長期存在的基準測試準確性爭議,此類信任危機此前在Meta等頭部公司身上也曾屢次上演。

業內資深人士紛紛呼籲,行業應當儘快建立統一規範,任何針對評測成績的修改都必須同步公開、明確說明評測條件的具體變化。當前,基準測試成績對於各大AI公司的市場定位與商業拓展具有舉足輕重的意義,但數據頻繁變動與由此引發的外界信任危機,不僅讓企業客戶和二級市場投資者難以準確評估模型的實際適配性,也對OpenAI長期的市場敘事和品牌公信力構成了不小的嚴峻挑戰。