7月17日,美团LongCat发布搜索智能体评测基准LoHoSearch。该基准基于包含762万个实体的维基百科知识图谱自动生成问题,旨在提升搜索空间和结构复杂度。LoHoSearch包含544道题,覆盖11个领域,采用树状与图结构组织,并已开源。测试显示,11个前沿模型中最高得分为34.74%,其后三个模型得分约15%至16%;同批模型在BrowseComp上可达到约90%。此外,上下文策略在LoHoSearch上最高仅带来6.8个百分点提升,低于BrowseComp的14个百分点。
7月17日,美团LongCat发布搜索智能体评测基准LoHoSearch。该基准基于包含762万个实体的维基百科知识图谱自动生成问题,旨在提升搜索空间和结构复杂度。LoHoSearch包含544道题,覆盖11个领域,采用树状与图结构组织,并已开源。测试显示,11个前沿模型中最高得分为34.74%,其后三个模型得分约15%至16%;同批模型在BrowseComp上可达到约90%。此外,上下文策略在LoHoSearch上最高仅带来6.8个百分点提升,低于BrowseComp的14个百分点。