遇见数据集

Forival/LiveBrowseComp

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

LiveBrowseComp数据集是一个用于评估搜索代理能力的基准数据集,包含335个复杂推理问题,覆盖历史、地理、影视、体育、政治和学术等多个领域。每个问题以JSONL格式存储,包括问题ID(idx)、问题描述(problem)和参考答案(answer)。问题设计为需要多跳推理和实时搜索才能解答,旨在测试代理在浏览和验证信息时的性能。数据集中的problem和answer字段经过XOR加密处理,以防止数据泄露污染大型语言模型的训练语料库,加密方法基于BrowseComp(OpenAI, 2025)方案,使用特定金丝雀字符串作为密码。解密后,问题示例显示为涉及南美国家电视行业的复杂描述。该数据集由HuiMing Fan等人于2026年发布,引用自相关研究论文。

The LiveBrowseComp dataset is a benchmark for evaluating search agents capabilities, consisting of 335 complex reasoning questions spanning multiple domains such as history, geography, film and television, sports, politics, and academia. Each question is stored in JSONL format, including a question ID (idx), problem description (problem), and reference answer (answer). The questions are designed to require multi-hop reasoning and live search to answer, aiming to test agents performance in browsing and verifying information. The problem and answer fields in the dataset are encrypted using an XOR cipher scheme to prevent data leakage from contaminating large language model training corpora, based on the BrowseComp (OpenAI, 2025) method with a specific canary string as the password. After decryption, an example question involves a complex description related to the television industry in a South American country. This dataset was published by HuiMing Fan et al. in 2026 and cited from relevant research papers.

提供机构:
Forival
搜集汇总
数据集介绍
Forival/LiveBrowseComp 数据集图片
构建方式
LiveBrowseComp数据集的构建旨在评估搜索代理在复杂多跳推理场景下的真实理解能力。该数据集包含335个精心设计的问题,覆盖历史、地理、影视、体育、政治及学术等多个知识领域。每个问题由多条线索交织而成,形成复杂的推理链条,要求模型不仅依赖既有知识,更需通过实时搜索获取并整合信息方能得出正确答案。为严防数据集泄露导致大模型训练语料污染,研究者采纳了与OpenAI BrowseComp方案一致的XOR加密算法,利用规范唯一标识字符串经SHA-256散列生成密钥,对问题与答案字段施以循环异或加密后以Base64编码存储,确保数据在公开环境中的安全性。
特点
该数据集最显著的特征在于其深度耦合了多跳推理与实时搜索两种能力要求。所有问题均无法仅凭模型内化知识直接解答,而必须经历从线索解析、搜索意图构建、网页信息筛选到跨来源推理验证的完整认知链。领域覆盖的广泛性与线索编排的隐蔽性使得单纯的事实检索或模式匹配失效,模型需在搜索过程中持续更新推理框架。此外,加密机制的设计不仅保护了测评数据的纯净性,更通过密文存储形式暗示了数据使用的门槛——用户必须主动执行解密流程方可获取明文,这在一定程度上模拟了真实世界中信息获取的原始性与非结构化特征。
使用方法
使用该数据集时,首先需从JSONL文件中读取加密记录,并调用官方提供的解密函数。解密函数依据预置的金丝雀字符串通过SHA-256生成32字节密钥,对Base64解码后的密文执行循环异或操作,还原出明文的problem与answer字段。随后,研究者可将解密后的问题输入待评估的搜索代理系统,收集其输出结果并与参考答案进行比对。典型评估指标包括准确率、搜索步数及信息整合效率。由于问题设计紧密依赖实时网络数据,建议评估环境配置稳定的互联网接入,并注意搜索时间窗口对结果复现性的潜在影响。
背景与挑战
背景概述
在大型语言模型日益广泛应用的当下,如何评估其真实的信息检索与推理能力成为学术界关注的焦点。LiveBrowseComp数据集由Fan HuiMing、Xiao Wang等研究者于2026年创建,旨在弥补现有基准测试在动态、多跳推理任务上的不足。该数据集包含335道复杂问题,覆盖历史、地理、影视、体育、政治及学术等多个领域,要求模型不仅依赖内部知识,还需通过实时网络搜索进行多步推理。其核心研究问题在于检验搜索代理究竟是在进行真实的信息探索,还是仅验证其已掌握的内容。该数据集在BrowseComp的基础上创新设计,对推动基于搜索的智能体评估具有重要影响力。
当前挑战
LiveBrowseComp所解决的领域挑战在于,传统静态基准测试无法有效度量模型在动态信息环境下的多跳推理能力,且现有数据集易因数据泄露而被模型记忆。构建过程中面临的主要挑战包括:设计既需要实时搜索又无法通过简单检索解决的高质量复杂问题,确保跨领域的平衡性与难度一致性;采用加密机制防止数据污染训练语料,但需在保密性与可复现性间寻求平衡;以及确保335道问题足够多样且能够区分模型在搜索与验证行为上的差异。这些挑战共同塑造了该数据集作为评估搜索代理真实能力的严苛标准。
常用场景
经典使用场景
LiveBrowseComp数据集专为评估现代搜索智能体在复杂多跳推理任务中的表现而设计。其核心使用场景要求模型在实时网络搜索过程中,整合来自历史、地理、影视、体育、政治及学术等多个领域的碎片化线索,最终得出精确答案。每个问题均经过精心构造,以检验智能体是否具备在动态信息环境中进行跨步骤逻辑串联与证据整合的能力。研究者通常利用该数据集衡量语言模型或检索增强系统在面对需要实时验证的、非事实性静态知识时的泛化性能与鲁棒性。
衍生相关工作
LiveBrowseComp的发布催生了一系列后续研究,包括对搜索智能体推理路径的细粒度可解释性分析,以及基于其加密方案构建的更对抗性测试基准。受其启发,研究者开发了动态知识蒸馏框架,使静态模型通过模仿实时搜索过程来增强常识更新能力。此外,该数据集还被用于验证多模态搜索系统中视觉与文本线索的协同推理策略,推动了从单一文本检索向跨模态实时问答范式的演进,并引出了关于‘搜索即推理’这一范式的新一轮学术讨论。
数据集最近研究
最新研究方向
LiveBrowseComp数据集聚焦于评估搜索代理在复杂多跳推理任务中的真实检索能力,而非依赖预存知识。其核心研究动向是探究大语言模型在实时网络搜索场景下,面对跨领域复杂线索(如历史、地理、影视等)时,能否进行动态信息整合与逻辑推导,以区分“搜索”与“验证”的本质差异。该数据集通过加密技术防止训练数据污染,为构建更可信的自主搜索代理提供了关键基准,推动了从静态知识记忆向动态信息获取的研究范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务