オープンAIは現地時間の9月3日に、新たなGPT-6 Astraモデルに関する発表を正式に開始したが、その公開には多くのトラブルが伴った。発表内容が掲載された直後、すぐに取り下げられ、ページが長時間アクセス不可能な状態となった。当初、公式側はこの出来事をコンテンツ管理システムの不具合やインターネット接続の中断によるものと説明し、記事の撤回がどの基準テスト結果とも関係していないことを強調した。

しかし、ブログの内容が再び掲載され、その後の更新により、このモデルの評価データが複数回にわたって変更されていることが分かった。特に論争を巻き起こしたのは、Astraの幻覚率が4.2%から一時的に2%まで大幅に低下した後、驚くほど最初の4.2%に戻ったことである。さらに、GPT-5.6 Solの幻覚率や内部ネットワークセキュリティ評価などの重要な成績も次々と変動している。注目すべきは、OpenAIの製品だけでなく、競合企業であるAnthropicの一部モデルの評価点数も同様に下がり、その後戻る傾向を示しており、一部のデータの変更が公式の初回ブログ掲載よりも前に行われていたことも判明した。

外部からの多くの疑問と混乱に対し、OpenAIはこれらの調整は、関連データがモデルの可用性を正確に反映するためのものであり、テスト条件などの客観的な要因が最終的な結果に影響を与える可能性があると説明した。それでも、このような頻繁なデータの変更は、AI専門家らから「スコアを操作している」という強い疑念を引き起こし、AI業界で長年存在する基準テストの正確性に関する議論を露呈させた。このような信頼危機は、Metaなど大手企業でも過去に繰り返し発生してきた。

業界のベテランたちは、業界が早急に統一された規範を確立し、すべての評価成績の変更について同時に公開し、評価条件の変化を明確に説明する必要があると呼びかけている。現在、ベースラインテストの成績は、各AI企業の市場的地位や商業展開において非常に重要であるが、データの頻繁な変動とそれに伴う信頼危機は、企業顧客や二次市場の投資家がモデルの実際の適合性を正確に評価することを困難にし、OpenAIの長期的な市場ストーリーおよびブランドの信頼性に対して大きな課題をもたらしている。