最近、OceanBaseチームが提出したData Agentの提案が国際的なデータエージェント基準Data Agent Benchmark(略称DAB)で首位に輝き、90.62%の正確率で1位を記録し、このランキングで初めて90%を超える正確率を達成した提案となりました。注目すべきは、この成績が中国製データベースであるOceanBaseと中国の大規模モデルGLM-5.2を基盤として構築されたものであり、GPTやClaude Opus、Claude Fableなどの海外モデルを基盤とするData Agentの提案を上回ったことです。今回の参加提案の内部通称はScoutで、関連する能力はOceanBase DataPilotに統合されます。

image.png

(図説:OceanBaseが国際Data Agentランキングを制覇、初めて90%を超える正確率を達成した提案)

DABはUC Berkeley EPIC Data LabとHasura PromptQLが共同で提供したもので、インターネット/ローカルライフ、金融株式、バイオ医療、知的財産権、企業運営、政府/公共管理、メディア/エンタメなど多くの分野をカバーしており、PostgreSQL、MongoDB、SQLite、DuckDBなど複数のデータベースにも対応しています。

従来のText-to-SQLではAIが自然言語をSQLに変換できるかを主に評価していましたが、DABではAIが現実のデータ環境に入り、複雑で分散し、形態が異なるデータから正しい答えを見つけることができるかを重視しています。一つの完全なタスクにおいて、Data Agentはデータを理解し、データを選択し、分析の計画を立て、クエリ計算を行い、結果を検証する必要があります。これは「データの理解」から「答えの取得」までの完全な能力をテストするものです。

このような理由から、DABは単なる下層モデルだけでなく、「モデル+エージェント+データシステム」の統合的な能力を試すものとなっています。モデルは理解と推論を担当し、エージェントは計画と実行を担当し、データシステムはデータの発見、関連計算、結果の検証を担います。これらの要素が協調して機能できるかどうかが、AIが企業のデータを実際に活用できるかどうかに直接影響します。

OceanBaseが今回参加した提案もこの能力に基づいて構築されています。システムはDataLensを通じてデータ画像を作成し、フィールドとデータ関係を識別します。その後、タスクの複雑さに応じて実行経路を計画し、データの選択、フィルタリング、関連付け、計算を行います。結果を得た後には、証拠の追跡と答えの検証によって計算過程と結果を確認し、問題が発見された場合は方針を調整し、再び検証することで、「データ理解-計画実行-検証修正」のクローズドループを形成します。

これにより、今回の90.62%という成績の価値が明らかになります。それは単に中国のモデルがデータクエリを完了できることを示すだけではなく、中国のデータベースと中国のモデルを組み合わせた場合に、複雑なデータ分析タスクを支えることができることを検証したものです。GLM-5.2という下層モデルを使用した場合でも、OceanBaseの提案はGPTやClaude Opus、Claude Fableなどの海外モデルを基盤とした複数のData Agentの提案を上回りました。

OceanBaseにとって、これはそのAI能力の新たな検証となるものです。

これまでデータベースは主にデータの保存、照会、処理を担当していました。AIエージェントが新たなデータユーザーとして登場するにつれて、データベースが解決すべき問題も変化しています。AIはデータを取得するだけでなく、データを理解し、データを関連付けて、データを分析し、結果の信頼性を確認する必要があります。AI時代のデータインフラも、もはや「データをAIに渡す」から、「AIがデータを活用できるように支援する」へと進化しています。

これがOceanBaseがデータベースからAIデータプラットフォームへと進化する方向です。OceanBase DataPilotはAIデータ分析のシナリオ向けの製品方向です。今回のDAB評価では内部通称Scoutの提案を提出し、関連技術能力は後ほどDataPilot製品に統合され、データ理解、タスク計画、分析実行、結果検証などの能力をさらに強化し、AIが「データを呼び出す」から「データを使ってタスクを完了する」へと進化するようにします。