遇见数据集

xlangai/BRIGHT

收藏
Hugging Face2025-03-01 更新2024-06-12 收录
官方服务:

资源简介:

BRIGHT是第一个需要深度推理来检索相关文档的文本检索基准测试。查询来源于多个领域(如StackExchange、LeetCode和数学竞赛),所有数据均来源于真实的人类数据。实验表明,现有的检索模型在BRIGHT基准测试上表现不佳,最高得分仅为21(nDCG@10)。BRIGHT为未来在更现实和具有挑战性的环境中进行检索研究提供了一个良好的测试平台。数据集包含三个子集:examples、documents和long_documents,分别用于存储查询、文档内容和长文档内容。

BRIGHT is the first text retrieval benchmark that requires intensive reasoning to retrieve relevant documents. The queries are collected from diverse domains (StackExchange, LeetCode, and math competitions), all sourced from realistic human data. Experiments show that existing retrieval models perform poorly on BRIGHT, where the highest score is only 21 measured by nDCG@10. BRIGHT provides a good testbed for future retrieval research in more realistic and challenging settings. The dataset consists of three subsets: examples, documents, and long_documents, which store queries, document content, and long document content, respectively.

提供机构:
xlangai
原始信息汇总

数据集概述

数据集配置

  1. documents

    • 特征:
      • id: 数据类型为字符串
      • content: 数据类型为字符串
    • 分割:
      • biology: 57359个示例,大小为21983744字节
      • earth_science: 121249个示例,大小为46952371字节
      • economics: 50220个示例,大小为22771374字节
      • psychology: 52835个示例,大小为23167414字节
      • robotics: 61961个示例,大小为20718385字节
      • stackoverflow: 107081个示例,大小为189733583字节
      • sustainable_living: 60792个示例,大小为24373723字节
      • leetcode: 413932个示例,大小为456581333字节
      • pony: 7894个示例,大小为2365157字节
      • aops: 188002个示例,大小为150030021字节
      • theoremqa: 188002个示例,大小为150970031字节
    • 下载大小: 478526058字节
    • 数据集大小: 1109647136字节
  2. examples

    • 特征:
      • query: 数据类型为字符串
      • reasoning: 数据类型为字符串
      • id: 数据类型为字符串
      • excluded_ids: 数据类型为字符串序列
      • gold_ids_long: 数据类型为字符串序列
      • gold_ids: 数据类型为字符串序列
    • 分割:
      • biology: 103个示例,大小为97602字节
      • earth_science: 116个示例,大小为117309字节
      • economics: 103个示例,大小为138625字节
      • psychology: 101个示例,大小为122512字节
      • robotics: 101个示例,大小为260593字节
      • stackoverflow: 117个示例,大小为230786字节
      • sustainable_living: 108个示例,大小为127770字节
      • leetcode: 142个示例,大小为1211646字节
      • pony: 112个示例,大小为140813字节
      • aops: 111个示例,大小为163737334字节
      • theoremqa: 206个示例,大小为184110371字节
    • 下载大小: 49347420字节
    • 数据集大小: 350295361字节
  3. long_documents

    • 特征:
      • id: 数据类型为字符串
      • content: 数据类型为字符串
    • 分割:
      • biology: 524个示例,大小为19454314字节
      • earth_science: 601个示例,大小为41843262字节
      • economics: 516个示例,大小为20095594字节
      • psychology: 512个示例,大小为20541239字节
      • robotics: 508个示例,大小为18220587字节
      • stackoverflow: 1858个示例,大小为184616744字节
      • sustainable_living: 554个示例,大小为21200303字节
      • pony: 577个示例,大小为2098474字节
    • 下载大小: 104544231字节
    • 数据集大小: 328070517字节

数据集结构

  • examples:
    • query: 检索查询
    • reasoning: 检索所需推理
    • id: 实例索引
    • excluded_ids: 评估中排除的文档索引
    • gold_ids_long: 与long_documents子集索引对应的真值文档索引
    • gold_ids: 与documents子集索引对应的真值文档索引
  • documents:
    • id: 文档索引
    • content: 文档内容(从完整网页、博客等分割的短版本)
  • long_documents:
    • id: 文档索引
    • content: 文档内容(与完整网页、博客等对应的完整版本)
搜集汇总
数据集介绍
构建方式
BRIGHT数据集由xlangai团队构建,旨在评估文本检索模型在需要深度推理的场景下的表现。该数据集从StackExchange、LeetCode、数学竞赛等多样化现实人类数据源中收集查询,覆盖生物学、地球科学、经济学、心理学、机器人学、可持续生活、编程、数学等领域。每个查询均附带人工标注的黄金推理步骤和对应的相关文档ID,文档分为短版本(documents)和长版本(long_documents),以支持不同粒度的检索任务。数据集还包含多个推理配置(如Gemini-1.0_reason、gpt4_reason等),由不同大语言模型生成的推理链构成,便于研究推理能力对检索的影响。
特点
BRIGHT的核心特色在于其推理密集型设计,现有检索模型在该基准上的最高nDCG@10得分仅为22.1,凸显了任务的挑战性。数据集规模适中(1K至10K个样本),但每个查询均对应大量候选文档(如leetcode子集包含超过41万篇文档),模拟了真实场景中的大规模检索需求。此外,数据集提供了排除ID列表以屏蔽部分领域中的潜在偏差,并统一了所有子集的格式,便于跨领域比较。其多样化的领域覆盖和多配置推理链为分析检索模型的泛化能力和推理依赖性提供了独特视角。
使用方法
使用HuggingFace的datasets库即可便捷加载BRIGHT数据。例如,通过`load_dataset('xlangai/BRIGHT', 'examples')['biology']`可获取生物学子集的查询示例。用户可根据研究目标选择不同配置(如'examples'、'documents'、'long_documents'或各推理配置),并利用'gold_ids'和'gold_ids_long'字段进行监督评估。对于theoremqa、aops和leetcode子集,需注意使用'excluded_ids'排除特定文档以确保公平评测。数据加载后,可直接用于训练或评估文本检索模型,尤其适用于需要深度语义匹配和推理能力的检索场景。
背景与挑战
背景概述
在信息检索领域,传统的检索基准多聚焦于词汇或语义层面的匹配,难以评估模型在复杂推理场景下的表现。由苏鸿锦、Howard Yen等学者于2024年提出的BRIGHT基准,旨在填补这一空白,其核心研究问题在于衡量检索模型在需要深度推理的多领域文本中的检索能力。该基准由xlangai团队创建,涵盖了生物学、地球科学、经济学、心理学、机器人学、StackExchange、LeetCode及数学竞赛等12个多样化子领域,所有查询均源自真实人类数据。实验表明,现有检索模型在BRIGHT上的最高nDCG@10得分仅为22.1,揭示了当前模型在推理密集型检索任务中的显著局限,为未来检索研究提供了更具现实性和挑战性的测试平台。
当前挑战
BRIGHT所解决的领域问题在于,传统检索任务多依赖表面相似性,而忽视了查询与文档之间隐含的复杂逻辑关系。其构建过程中面临的核心挑战包括:1)跨领域数据的异构性,需统一来自代码、数学推理、自然科学等差异显著来源的查询与文档格式,确保评估的公平性;2)推理步骤的精确标注,数据集为每个查询提供了人工注释的推理过程,但如何保证这些推理链的完整性与一致性,避免噪声干扰;3)大规模长文档的索引难题,特别针对StackExchange和LeetCode等包含超长内容的子集,现有检索模型在处理长距离依赖时表现不佳,导致相关性判断失误。
常用场景
经典使用场景
在信息检索与自然语言处理的交叉领域中,BRIGHT基准数据集被广泛用于评估和提升检索模型在复杂推理场景下的性能。其核心设计理念在于,查询语句并非简单的关键词匹配,而是需要模型具备深度语义理解与逻辑推理能力,才能从海量文档中精准定位相关结果。该数据集涵盖生物学、地球科学、经济学、心理学、机器人学、编程问答(StackOverflow、LeetCode)以及数学竞赛等多个学科,每个领域均包含由人类标注的推理步骤,为研究者提供了丰富的多领域测试素材。经典使用方式是将查询与文档库进行匹配,通过nDCG@10等指标衡量模型在推理密集型检索任务中的表现,现有顶尖模型在该基准上的得分仅为22.1,凸显了其挑战性与研究价值。
解决学术问题
BRIGHT基准数据集精准回应了传统文本检索评估中缺乏推理深度这一学术困境。长期以来,主流检索基准如MS MARCO或Natural Questions侧重于词汇或浅层语义匹配,难以反映真实世界中用户需要复杂逻辑推演才能找到答案的场景。BRIGHT通过引入需要多步推理的查询(例如数学定理证明或编程问题解决),揭示了现有密集检索模型与稀疏检索方法在推理密集型任务中的显著短板,推动学界重新审视检索范式的设计。其意义在于建立了一个更具现实挑战性的评估框架,促使研究者从简单的向量相似度计算转向融合推理能力的检索架构,对发展下一代智能信息获取系统具有深远影响。
衍生相关工作
BRIGHT数据集的发布催生了一系列富有启发性的衍生研究工作。在模型架构层面,研究者开始探索将大语言模型(如GPT-4、Llama)生成的推理链显式融入检索流程,例如利用BRIGHT提供的多模型推理标注(Gemini、Claude、GPT-4等)训练可解释的检索增强系统。在评估方法上,该基准推动了从单一相关性度量向多维度推理质量评估的转变,部分工作借鉴其领域划分策略构建了面向特定学科(如生物学或经济学)的推理检索子集。此外,BRIGHT中长文档与短文档的双轨设计(documents与long_documents配置)激发了针对不同粒度文本的检索策略研究,包括分块匹配与层级检索融合等创新方案,这些工作共同丰富了检索领域的理论工具箱。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务