搜索智能體到底有多強,過去一年基本是BrowseComp說了算。但這個標尺正在失靈——它在10個月內就把模型成績從30%一路推到了90%,基準測試本身的意義正快速被刷沒。7月17日,美團LongCat拋出了一塊更硬的試金石LoHoSearch,意圖把搜索智能體重新逼回爬坡區。

LoHoSearch的難題不是人寫的,而是從一個囊括762萬個實體的維基百科知識圖譜裏自動生成的。正因爲這種機器生成的出身,它在搜索空間和結構複雜度上,抵達了人類標註者根本無法穩定設計出的難度上限。換句話說,過去的基準靠人腦出題,題目再難也有天花板;LoHoSearch把出題權交給圖譜,難度天花板被徹底掀開。

結果相當刺眼。在11個前沿模型的測試中,最佳成績只有34.74%,緊隨其後的三個模型集中在15%到16%左右;而同一批頂尖模型在BrowseComp上眼下能拿到約90%的分數。差距之大,直觀說明LoHoSearch把搜索智能體真正的短板暴露了出來。更有意思的是上下文策略的邊際效用:在LoHoSearch上,最好的上下文策略只帶來6.8個百分點的提升,而同樣的操作在BrowseComp上能換回14個百分點——這意味着靠提示和上下文工程去補能力的老辦法,在這套新基準裏幾乎失靈。
這套基準本身有544道問題,覆蓋11個領域,問題採用樹狀與圖結構組織,且已經開源。當老基準被刷到頂、搜索agent的真正挑戰纔剛開始,LoHoSearch很可能成爲下一個繞不開的必測項。
