当前位置: 首页 » 资讯 » 科技头条 » 正文

BrowseComp被刷到90%后,美团LongCat甩出LoHoSearch:前沿模型集体跌回三成出头

IP属地 中国·北京 编辑:江紫萱 Chinaz 时间:2026-07-20 10:06:46

搜索智能体到底有多强,过去一年基本是BrowseComp说了算。但这个标尺正在失灵——它在10个月内就把模型成绩从30%一路推到了90%,基准测试本身的意义正快速被刷没。7月17日,美团LongCat抛出了一块更硬的试金石LoHoSearch,意图把搜索智能体重新逼回爬坡区。

LoHoSearch的难题不是人写的,而是从一个囊括762万个实体的维基百科知识图谱里自动生成的。正因为这种机器生成的出身,它在搜索空间和结构复杂度上,抵达了人类标注者根本无法稳定设计出的难度上限。换句话说,过去的基准靠人脑出题,题目再难也有天花板;LoHoSearch把出题权交给图谱,难度天花板被彻底掀开。

结果相当刺眼。在11个前沿模型的测试中,最佳成绩只有34.74%,紧随其后的三个模型集中在15%到16%左右;而同一批顶尖模型在BrowseComp上眼下能拿到约90%的分数。差距之大,直观说明LoHoSearch把搜索智能体真正的短板暴露了出来。更有意思的是上下文策略的边际效用:在LoHoSearch上,最好的上下文策略只带来6.8个百分点的提升,而同样的操作在BrowseComp上能换回14个百分点——这意味着靠提示和上下文工程去补能力的老办法,在这套新基准里几乎失灵。

这套基准本身有544道问题,覆盖11个领域,问题采用树状与图结构组织,且已经开源。当老基准被刷到顶、搜索agent的真正挑战才刚开始,LoHoSearch很可能成为下一个绕不开的必测项。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。