LongMemEvalDoc
收藏资源简介:
该数据集是一个用于信息检索任务的数据集,包含三个主要组成部分:文档语料库、查询集合和查询-文档相关性标注。文档语料库包含19,195个文档,每个文档具有唯一标识符、标题和正文文本。查询集合包含500个查询语句,每个查询具有唯一标识符和查询文本。相关性标注数据包含948个测试样本,每个样本记录了查询标识符、文档标识符以及一个整数类型的相关性分数,用于评估检索系统的性能。数据集适用于文档检索、信息检索系统评估和相关性排序等任务。
This dataset is designed for information retrieval tasks and consists of three main components: a document corpus, a query set, and query-document relevance annotations. The document corpus contains 19,195 documents, each with a unique identifier, title, and body text. The query set includes 500 query statements, each with a unique identifier and query text. The relevance annotation data comprises 948 test samples, each recording a query identifier, document identifier, and an integer-type relevance score for evaluating the performance of retrieval systems. The dataset is suitable for tasks such as document retrieval, information retrieval system evaluation, and relevance ranking.
数据集概述
数据集名称: LongMemEvalDoc
数据集地址: https://huggingface.co/datasets/bowang0911/LongMemEvalDoc
配置与结构
该数据集包含三个配置(config),每个配置对应不同的数据用途:
-
corpus(语料库)
- 特征:
_id(字符串)、title(字符串)、text(字符串) - 数据划分: 一个名为
corpus的划分,包含 19,195 个样本,总字节数约 200 MB。 - 数据文件路径:
corpus/corpus-*
- 特征:
-
default(默认/查询-语料对)
- 特征:
query-id(字符串)、corpus-id(字符串)、score(整数) - 数据划分: 一个名为
test的划分,包含 948 个样本,总字节数约 40 KB。 - 数据文件路径:
data/test-*
- 特征:
-
queries(查询)
- 特征:
_id(字符串)、text(字符串) - 数据划分: 一个名为
queries的划分,包含 500 个样本,总字节数约 51 KB。 - 数据文件路径:
queries/queries-*
- 特征:
数据规模
- 语料库(corpus): 19,195 个文档(含标题和文本)
- 查询(queries): 500 个查询文本
- 测试对(test): 948 个查询-语料关联对(含相关性分数)




