搜索智能体基准BrowseComp“失效”后,美团推出更严苛的LoHoSearch
过去一年,衡量搜索智能体能力的标尺基本由BrowseComp把持。但这个基准正在快速失灵——短短10个月内,模型成绩从30%飙升至90%,测试本身的意义被稀释殆尽。7月17日,美团旗下LongCat团队发布全新基准LoHoSearch,试图将搜索智能体重新拉回真正的挑战区。
与以往由人类出题不同,LoHoSearch的题目源自一个包含762万个实体的维基百科知识图谱,通过机器自动生成。这种机制使其在搜索空间和结构复杂度上突破了人类标注者难以触及的难度上限。如果说过去的基准依赖人脑设计,题目难度存在天然天花板;那么LoHoSearch则将出题权交给知识图谱,彻底掀开了这重限制。
测试结果颇为严峻。在11个前沿模型的测试中,最佳成绩仅为34.74%,紧随其后的三个模型集中在15%至16%区间;而同一批顶尖模型在BrowseComp上已能斩获约90%的分数。悬殊差距直观表明,LoHoSearch精准暴露了当前搜索智能体的真实短板。
上下文策略的边际效用同样呈现分化。在LoHoSearch上,最优上下文策略仅带来6.8个百分点的提升,而同等操作在BrowseComp上能换回14个百分点。这意味着依赖提示工程和上下文修补的传统路径,在这套新基准中几近失效。
据悉,LoHoSearch包含544道问题,覆盖11个领域,采用树状与图结构组织,目前已开源。当旧基准被逐步刷穿,搜索智能体的真正挑战才刚刚开始,LoHoSearch或将成为行业下一个绕不开的必测项。