検索エージェントの強さは、過去1年間は主にBrowseCompに左右されていた。しかし、この基準はもはや機能していない——10か月でモデルの成績が30%から90%まで急上昇し、ベンチマークテストそのものの意味は急速に薄れつつある。7月17日、メイドゥン(Meituan)のLongCatは、より厳しい試金石であるLoHoSearchを提示し、検索エージェントを再び爬坡区へと押し戻そうとした。

LoHoSearchの課題は人間が作成したわけではない。これは762万個のエンティティを含むウィキペディア知識グラフから自動生成されたものだ。このような機械生成の背景があるため、検索空間と構造の複雑さにおいて、人間が安定して設計できない難易度の上限に達している。言い換えれば、これまでのベンチマークは人間が問題を作成していたが、問題がどれだけ難しくても限界があったが、LoHoSearchでは問題作成権をグラフに委ねることで、難易度の上限は完全に取り払われた。

結果はかなり目立ちます。11の先進モデルのテストにおいて、最高成績は34.74%にとどまり、続く3つのモデルは15%〜16%前後でした。一方で、同じ一連のトップモデルはBrowseCompでは今や約90%の点数を取っています。この大きな差は、LoHoSearchが検索エージェントの本質的な欠点を露呈していることを示しています。さらに興味深いのは、文脈戦略の限界効用です:LoHoSearchでは最良の文脈戦略でも6.8ポイントの改善しかもたらしませんでしたが、同じ操作がBrowseCompでは14ポイントの改善をもたらしました——これは、提示や文脈工学による能力補完という従来の方法が、この新しいベンチマークではほぼ機能しなくなったことを意味しています。
このベンチマーク自体には544の質問があり、11の分野をカバーしており、質問はツリー構造と図構造で整理されており、すでにオープンソース化されています。古いベンチマークが頂点に達した今、検索エージェントの真正のチャレンジが始まるのです。LoHoSearchは次の回避できない必須テストになる可能性が高いです。
