RECOR
收藏资源简介:
RECOR Benchmark是一个专注于评估推理密集型对话信息检索系统的多轮对话检索基准数据集。它包含两个主要子集:benchmark(707个多轮对话)和corpus(文档语料库,包含正面和负面文档)。数据集覆盖11个领域,包括生物学、地球科学、经济学、心理学、机器人学、可持续生活、无人机、硬件、法律、医学科学和政治学。每个对话包含多个回合,每个回合有用户问题、答案、相关文档ID、对话历史、子问题推理等字段。文档语料库包含文档ID和内容。数据集结构清晰,提供了详细的字段描述和使用示例。
The RECOR Benchmark is a multi-turn dialogue retrieval benchmark dataset dedicated to evaluating reasoning-intensive conversational information retrieval systems. It consists of two primary subsets: the benchmark subset (707 multi-turn dialogues) and the corpus subset (document corpus containing both positive and negative documents). The dataset covers 11 domains including biology, earth science, economics, psychology, robotics, sustainable living, drones, hardware, law, medical science, and political science. Each dialogue comprises multiple turns, where each turn contains fields such as user query, answer, relevant document ID, dialogue history, and sub-question reasoning. The document corpus includes document IDs and their corresponding content. The dataset has a well-defined structure, with detailed field descriptions and usage examples provided.
RECOR 数据集概述
数据集基本信息
- 数据集名称: RECOR Benchmark
- 托管地址: https://huggingface.co/datasets/RECOR-Benchmark/RECOR
- 许可证: MIT License
- 主要任务类别: 问答、文本检索
- 语言: 英语
- 规模: 1K<n<10K
- 标签: 会话式信息检索、信息检索、多轮对话、推理、基准测试
数据集构成与统计
整体统计
- 总对话数: 707
- 总轮次数: 2,971
- 领域数: 11
- 平均每对话轮次数: 4.2
领域划分与统计
数据来源与领域:
- BRIGHT: biology, earth_science, economics, psychology, robotics, sustainable_living
- StackExchange: Drones, hardware, law, medicalsciences, politics
各领域详细统计:
| 领域 | 对话数 | 轮次数 |
|---|---|---|
| biology | 85 | 362 |
| earth_science | 98 | 454 |
| economics | 74 | 288 |
| psychology | 84 | 333 |
| robotics | 68 | 259 |
| sustainable_living | 78 | 319 |
| Drones | 37 | 142 |
| hardware | 46 | 188 |
| law | 50 | 230 |
| medicalsciences | 44 | 183 |
| politics | 43 | 213 |
数据集结构
子集配置
数据集包含两个主要子集:
- benchmark: 包含707个多轮对话,用于推理密集型会话信息检索系统的评估。
- corpus: 文档语料库(包含正负文档)。
每个子集均按上述11个领域进行划分。
数据字段说明
Benchmark(对话)字段:
id: 唯一对话标识符task: 领域名称original_query: 初始用户问题original_answer: 对初始问题的回答turns: 对话轮次列表metadata: 对话元数据
Metadata 元数据字段:
num_turns: 对话轮次数gold_doc_count: 相关文档总数version: 数据集版本created_at: 创建时间戳source: 数据来源(bright 或 annotated_data)method: 生成方法
每个对话轮次(turn)包含的字段:
turn_id: 轮次编号(从1开始)query: 当前轮次的用户问题answer: 黄金答案gold_doc_ids: 相关文档ID列表conversation_history: 先前轮次的上下文subquestion_reasoning: 后续问题的推理过程subquestion_reasoning_metadata: 结构化推理元数据
subquestion_reasoning_metadata 推理元数据字段:
target_information: 查询所寻求的信息relevance_signals: 表示相关性的关键词/概念irrelevance_signals: 表示不相关性的关键词/概念
Corpus(文档)字段:
doc_id: 唯一文档标识符content: 文档文本
文件结构
data/ ├── benchmark/ # 对话数据(11个文件) │ └── {domain}_benchmark.jsonl └── corpus/ # 文档数据(11个文件) └── {domain}_documents.jsonl
使用方式
可通过 datasets 库加载特定领域或全部领域的数据。支持加载的领域包括:biology, earth_science, economics, psychology, robotics, sustainable_living, Drones, hardware, law, medicalsciences, politics。
评估
评估代码和指标请参考 GitHub 仓库:https://github.com/RECOR-Benchmark/RECOR。




