BrowseComp达到90%后,美团LongCat推出LoHoSearch,前沿模型成绩集体回落至三成出头

搜索智能体评测基准BrowseComp短期内被“刷爆”,成绩由约30%飙升至90%,评测有效性受到影响。7月17日,美团LongCat发布新基准LoHoSearch,基于含762万实体的维基百科知识图谱自动生成高难度问题,使前沿模型成绩集体回落至三成出头,并重新衡量搜索智能体能力。
过去一年,BrowseComp几乎一直被视为衡量搜索智能体能力的重要标尺。然而,这一基准正在迅速失去区分度:短短10个月,模型成绩便从30%提升至90%左右,测试结果的含金量也随之被不断削弱。7月17日,美团LongCat发布LoHoSearch,试图为搜索智能体设置一道更具挑战性的关卡,让这一领域重新回到持续提升能力的阶段。

LoHoSearch并非由人工直接编写题目,而是基于一个收录762万个实体的维基百科知识图谱自动生成问题。由于题目来源于机器构建的知识结构,这套基准在搜索范围和问题组织复杂度上,突破了人工出题能够稳定控制的难度边界。此前的基准测试主要依赖人类设计问题,复杂程度始终受到人工设计能力限制;LoHoSearch则把出题过程交给知识图谱,进一步拓展了问题难度的上限。

测试结果显示,11个前沿模型中,最高得分仅为34.74%,其后3个模型的成绩集中在15%至16%左右。相比之下,这批顶尖模型目前在BrowseComp上的得分已经达到约90%。两组结果形成了明显反差,也表明LoHoSearch更直接地暴露出搜索智能体在复杂检索任务中的能力短板。
上下文策略带来的提升幅度同样值得关注。在LoHoSearch上,表现最好的上下文策略只能带来6.8个百分点的增益;在BrowseComp中,类似策略则可以提升14个百分点。这说明,单纯依靠提示词和上下文工程弥补模型能力的传统方式,在LoHoSearch所构建的测试环境中效果明显减弱。
目前,LoHoSearch包含544道问题,覆盖11个领域,题目通过树状结构和图结构进行组织,并已对外开源。当BrowseComp的成绩逐渐被推向高位,搜索智能体面临的更大挑战才刚刚显现。凭借更复杂的问题生成方式和较低的模型得分,LoHoSearch或将成为后续评估搜索智能体时难以绕开的测试基准。
