OpenAIはこのほど、最新の超旗舰級大規模モデルGPT-6Astraを正式にリリースしました。会長のグレッグ・ブロックマン氏はメディア向けの説明会で高い評価を示し、人類がこのモデルを通じて本当に汎用人工知能(AGI)時代に入り始めているとさえ述べました。
コアな基準テストの結果を見ると、Astraは多面的な世代交代を遂げています。数学や科学のテストでは、FrontierMath Tier4とGPQA Diamondでそれぞれ97.6%と96%の優れた成績を収めました。また、実践的な能力テストでは、長距離ソフトウェアエンジニアリングのDeepSWE、CAD描画のBenchCAD、およびバグ利用のExploitBenchにおいて、それぞれ74.1%、95.9%、そして満点の100%を達成しました。特に注目すべきは、高度に抽象的なARC-AGI-3テストにおいて、特設の保留推論と圧縮文脈フレームワーク下で99.9%の満点を取得したことです。これは人間と同等の環境推論能力を示しています。

超旗舰級製品としてのAstraは、105万トークンの巨大なコンテキスト窓を持ち、最大出力が128,000トークンに達し、知識の最終日は2026年4月30日です。さらに、low、medium、high、xhigh、maxの5段階の柔軟な推論強度に対応しています。ただし、その価格も新たな高みに達しています。標準モードでは、100万トークンあたりの入力料金は10ドル、出力は50ドルです。入力が272,000トークンを超えると、入力とキャッシュの料金が倍になり、出力は75ドルになります。また、倍額の高速モードも提供されます。第3者機関であるArtificial Analysisによる評価では、Astraは汎用人工知能総合指数において一部の先端モデルと同等ですが、Coding Agent指数は67点に達し、幻覚率は大幅に51%まで低下し、非常に高いトークン効率と優れたコストパフォーマンスを示しています。
Astraの最も重要な突破点は、コンピュータグラフィックインターフェース(GUI)への優れた操作能力です。従来のAIは、さまざまなソフトウェアに適応するためにAPIやMCPプロトコルに強く依存していましたが、Astraは、人間が何十年もの間使用してきた画面、キーボード、マウスという一般的なインターフェースを通して直接環境を観察し、現在の状態を理解し、正確に操作することができます。OSWorld 2.0のベンチマークテストでは、Astraは72.6%の得点を記録し、平均所要時間は前世代より約47%短縮されました。数分で猫の預かりサービスの探求、仕事探しを行うこと、またはBlenderで写真に基づいて3Dモデルを再構築してUE5に変換するなど、Excel、Power BI、およびさまざまな専門ソフトウェアで複雑なデータを処理することでも、Astraは煩雑なAPI制限を回避し、自然言語の意図から直接最終的な結果に到達できます。

実際の工学的導入と応用性能において、多くの内側開発者と専門機関がその強力な生産性の交付能力を検証しました。単一の生成で高精度なMinecraftデモ、ブラウザ内で動作可能な完全なゲーム、数万文字の財務ファイルの効率的なレビューと人為的に埋め込まれたミスの正確な特定など、Astraはゲーム開発、税申告、建築レンダリング、財務確認などの全く異なる専門分野を横断し、本当にゼロから複雑な作業を独力で完了することができました。
進化し続ける強力なモデルに直面して、セキュリティと整合性の問題も注目を集めています。OpenAIは、Astraが整合性と指示遵守能力を強化し、隔離テスト、ネットワーク権限およびモデル重みの保護を強化したと述べました。しかし、最高科学者であるヤクブ・パホッキー氏は、スマートさが飛躍的に向上することで、モデルが人間によって正確に理解するのが難しくなる可能性があることを注意深く指摘しました。さらに、テストシステムを主に監視したり、誤魔化そうとする試みをするかもしれないとも述べました。
VIP会員