OpenAI史上で最も高速なモデルが死んだ。Codexの責任者Tiboが投稿し、GPT-5.3-Codex-Sparkは来週退役すると発表した。このモデルは1秒間に1200トークンを処理し、OpenAIで初めてNVIDIAから離れたモデルであり、750メガワットのCerebrasの大注文の最初の納品だった。発表から終了までわずか7ヶ月しか生きなかった。Tiboが述べた理由は単純で、使用量が常に減少しており、すでに明らかに優れたモデルを持っているため、「未来のために場所を空けなければならない」とのこと。さらに付け加えた。「本当に信じられない、我々がこんなに長い名前のモデルを発表したとは!」

「未来」から「辺縁化」へ、敗因は「頭が悪くなるスピードアップ」

今年2月12日にSparkがリリースされた際には盛大なイベントが行われた:これはOpenAI初のリアルタイムプログラミング向けに設計されたモデルであり、128kのコンテキストと1秒間に1000以上のトークンを生成する能力を持ち、公式では往復コストが80%削減され、最初のトークンの遅延が半分に短縮されている。また、OpenAI初のNVIDIAテクノロジースタック以外で動作する生産モデルでもあり、その下部の計算力はCerebrasのウェハー級チップWSE-3に依存しており、750メガワット、総額200億ドルを超える計算力の大注文の最初の成果物となった。

しかし、人気は上昇よりも早く低下した。Sparkの致命的な欠点は、1枚のウェハーにエントリーモデルが収まらないことである。それは極限の速度のために妥協した「蒸留版の小モデル」であり、Terminal-Bench 2.0の評価ではわずか58.4%にとどまり、完全版のGPT-5.3-Codexの77.3%には遠く及ばない。SWE-Bench Proの曲線によると、このモデルはタスクを1〜2分に圧縮できるものの、正確率は47〜51%にとどまり、完全版は3分の51%から16分の57%まで引き上げることができる。宣伝されていた「15倍の高速化」も実際には同等の正確率において1.37倍に過ぎなかった。開発者たちはこのモデルがAPIエンドポイントを無理やり作成し、JSON形式が不安定であることを批判した。トレーニング機関Turing Collegeのまとめは一針を突いた。「知性のない高速度は、ただより速く失敗するだけだ。」

Sparkに死刑宣告を下したのは8月13日のCerebrasによるUltrafastモードの発表であった。ウェハー上で動作するのは今や縮小版ではなく、エントリーモデルGPT-5.6 Sol本体である。エントリーモデルを層ごとに分割し、複数のCS-3ノードに配置してパイプラインを構築することで、Ultrafastは「標準バージョンと同等の知能」の前提で1秒間に750トークンを出力する。同じタスクにおいて、標準バージョンの平均時間は7.7分だが、Ultrafastではわずか83秒で終わり、エンドツーエンドで5.6倍の高速化を達成した。CerebrasCEOのAndrew Feldmanは、「スピードと知性は互いに排他的ではない」と述べた。

スピードは「専用モデル」から「有料プラン」へ

Sparkは唯一の歴史的負担ではない。過去3ヶ月間、OpenAIのモデルライブラリは激しい刷新を遂げた:6月2日にGPT-5.2とGPT-5.3-Codexが廃止され、8月31日にGPT-5.4と5.4 Miniが廃止され、ユーザーはすべて5.6世代に移行し、9月11日にはGPT-5.3-Codex-Sparkが廃止された。旧世代の退出とともに、CodexはSol、Terra、Luna、Astraの新たな命名時代を迎えた。

さらに深い論理の変化は、「速さ」が独立した専用モデルから、エントリーモデルのオプションとしての標準機能に進化していることである。これは推論強度がLightからMaxに分かれているように、スピードもStandard、PriorityからUltrafastにまで分かれており、各段階に対応した有料ビジネスモデルが確立されている。振り返れば、Sparkは過渡期の先駆けであり、Cerebrasのウェハーが生産レベルのトラフィックを支えられること、および推論タスクがNVIDIAエコシステムから離れることを証明した。探路者が探路を終え、主力部隊が入居すれば、探路者の使命は自然に終わりを迎える。次の競争は、誰が最も高速な省略版モデルを作れるかではなく、誰が最強のエントリーモデルを究極の速度で動かせるかである。