遇见数据集

meituan-longcat/LoHoSearch

收藏
Hugging Face2026-06-12 更新2026-06-21 收录
官方服务:

资源简介:

LoHoSearch(长视野搜索代理)是一个具有挑战性的基准测试数据集,用于评估搜索代理在长视野推理和上下文管理方面的能力。它包含544个人工验证的问题,涵盖11个领域,基于覆盖超过700万维基百科实体的知识图谱构建。该数据集通过自动化流程生成,选择具有大搜索空间的关系,并将其组合成结构复杂的问题,确保每个问题有唯一的答案。数据集分为两个子集:benchmark(测试集,包含544条记录,经过人工验证)和train(训练集,包含2000条记录,由相同自动化流程生成但未经人工验证)。所有数据均为英文。

LoHoSearch (Long-Horizon Search Agents) is a challenging benchmark for evaluating long-horizon reasoning and context management in search agents. It comprises 544 human-verified questions across 11 domains, constructed via an automated pipeline built upon a knowledge graph covering over 7 million Wikipedia entities. The pipeline selects relations with large search spaces and assembles them into structurally complex questions with KG-verified unique answers. The dataset includes two subsets: benchmark (test set with 544 records, human-verified) and train (training set with 2000 records, generated by the same automated pipeline without human verification). All data is in English.

提供机构:
meituan-longcat
搜集汇总
数据集介绍
meituan-longcat/LoHoSearch 数据集图片
构建方式
LoHoSearch的构建基于覆盖超过700万维基百科实体的知识图谱,通过自动化管道实现。首先,利用完整的英文维基百科数据与Wikidata类型注释构建大规模知识图谱。随后,通过子图采样策略,抽取树状与图状结构子图,并施加搜索空间规模、结构复杂度及答案唯一性等约束。在此基础上,提取并混淆实体关系,将其组装为自然语言问题,并通过自动化覆盖度与满足度检查进行验证。最后,经过多轮唯一性验证、难度筛选及专业人工审核,确保每个问题均具备高质量与验证性。该流程共生成544个人工验证的测试问题及2000个无人工验证的训练问题,覆盖11个领域。
使用方法
LoHoSearch的使用方式明确围绕搜索代理的评估与训练展开。用户可利用benchmark配置加载包含544个测试问题的LoHoSearch.csv文件,或利用train配置加载含2000个训练样本的train.csv文件。每个模型需配备search(关键词搜索)与browse(获取URL内容)两种工具,并采用与BrowseComp相同的系统提示。评估时,设置温度为1.0,上下文窗口为200K(输入184K,输出16K),通过两个互补的LLM裁判(GPT-4.1与Qwen2.5-32B)分别评分后取平均,以平衡单一评判标准的严苛或宽松倾向。
背景与挑战
背景概述
随着搜索智能体基准测试如BrowseComp的迅速饱和,最强模型已突破90%的准确率,但这类人类主导构建的基准受限于标注者缺乏对实体全局统计的宏观视角,难以系统性地最大化搜索空间规模与结构复杂度,形成了难以逾越的难度天花板。为突破这一瓶颈,由Zhao等研究团队于2026年提出的LoHoSearch数据集,基于覆盖超过700万维基百科实体的知识图谱,通过自动化流水线构建了包含544个人工验证问题的基准。该数据集横跨11个领域,利用大规模搜索空间的关系选择与图结构组装,生成知识图谱验证的唯一答案问题,在长程推理与上下文管理领域树立了更严苛的评估标准,推动搜索智能体能力向超越人类难度上限迈进。
当前挑战
LoHoSearch所解决的核心领域挑战在于现有搜索智能体基准因人类认知局限而存在的难度天花板,即人类标注者无法系统设计出兼具广阔搜索空间与复杂图结构的问题,导致模型性能快速饱和。在构建过程中,挑战主要体现为四个方面:首先是从超过700万维基百科实体中构建知识图谱并进行精确类型标注;其次是子图采样需同时满足搜索空间规模、结构复杂度与答案唯一性的严格约束;再次是QA生成阶段的关系提取、混淆与自然语言组装需要自动化验证覆盖度与一致性;最后是后处理需经过多轮唯一性验证、难度过滤与专业人工审核,确保544个问题的质量与区分度。
常用场景
经典使用场景
LoHoSearch作为评估长程推理搜索代理的标杆性数据集,其经典应用场景聚焦于检验模型在多跳信息检索与复杂上下文管理中的表现。研究者利用该数据集系统性地测试搜索代理在面对结构化知识图谱衍生的高难度问题时,能否在超大规模搜索空间中准确追踪实体关联路径、筛选冗余信息并最终输出唯一正确答案。其典型实验设计包括为模型配备搜索与浏览工具,在受限上下文窗口内完成长达数轮的自主推理,从而衡量其跨越人类能力天花板的长程推理极限。
解决学术问题
该数据集精准回应了现有搜索代理评测基准因依赖人工构建而存在的难度天花板困境。传统基准如BrowseComp因标注者缺乏全局实体统计视角,难以生成搜索空间庞大且结构复杂的题目,导致顶级模型准确率已突破90%。LoHoSearch通过自动化流水线基于覆盖700万维基百科实体的知识图谱,系统性地选取具有大搜索空间的实体关系,组装成具有唯一验证答案的复杂问题,将最强模型的准确率骤降至34.74%,为长程推理与上下文管理的研究设立了更高且更具区分度的评估标准。
实际应用
在产业实践中,LoHoSearch所代表的评测范式可深度赋能智能搜索引擎、企业级知识库问答系统及科研文献检索工具的开发与优化。具体而言,该数据集能够作为验证下一代搜索代理在金融分析、法律案例推理、医学文献综述等需多步证据链整合场景中实用效能的压力测试平台。通过暴露模型在长序列上下文中的信息遗忘与路径选择缺陷,它推动开发者针对性地设计记忆增强机制、动态剪枝策略及结构化知识融合方案,最终提升自动化信息检索系统的鲁棒性与决策可靠性。
数据集最近研究
最新研究方向
LoHoSearch数据集的研究聚焦于突破传统搜索智能体重于人工标注带来的难度天花板,通过自动化管道基于涵盖700万以上维基百科实体的知识图谱构造具有大搜索空间与复杂结构问题的评测基准。前沿方向包括长程推理与上下文管理能力评估,实验揭示最强模型GPT-5.5仅达34.74%准确率,凸显现有策略增益有限及任务艰巨性,推动搜索智能体迈向更高难度、更接近真实复杂信息检索挑战的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务