遇见数据集

LongMemEvalDoc

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

该数据集是一个用于信息检索任务的数据集,包含三个主要组成部分:文档语料库、查询集合和查询-文档相关性标注。文档语料库包含19,195个文档,每个文档具有唯一标识符、标题和正文文本。查询集合包含500个查询语句,每个查询具有唯一标识符和查询文本。相关性标注数据包含948个测试样本,每个样本记录了查询标识符、文档标识符以及一个整数类型的相关性分数,用于评估检索系统的性能。数据集适用于文档检索、信息检索系统评估和相关性排序等任务。

This dataset is designed for information retrieval tasks and consists of three main components: a document corpus, a query set, and query-document relevance annotations. The document corpus contains 19,195 documents, each with a unique identifier, title, and body text. The query set includes 500 query statements, each with a unique identifier and query text. The relevance annotation data comprises 948 test samples, each recording a query identifier, document identifier, and an integer-type relevance score for evaluating the performance of retrieval systems. The dataset is suitable for tasks such as document retrieval, information retrieval system evaluation, and relevance ranking.

创建时间:
2026-07-01
原始信息汇总

数据集概述

数据集名称: LongMemEvalDoc

数据集地址: https://huggingface.co/datasets/bowang0911/LongMemEvalDoc

配置与结构

该数据集包含三个配置(config),每个配置对应不同的数据用途:

  1. corpus(语料库)

    • 特征: _id(字符串)、title(字符串)、text(字符串)
    • 数据划分: 一个名为 corpus 的划分,包含 19,195 个样本,总字节数约 200 MB。
    • 数据文件路径: corpus/corpus-*
  2. default(默认/查询-语料对)

    • 特征: query-id(字符串)、corpus-id(字符串)、score(整数)
    • 数据划分: 一个名为 test 的划分,包含 948 个样本,总字节数约 40 KB。
    • 数据文件路径: data/test-*
  3. queries(查询)

    • 特征: _id(字符串)、text(字符串)
    • 数据划分: 一个名为 queries 的划分,包含 500 个样本,总字节数约 51 KB。
    • 数据文件路径: queries/queries-*

数据规模

  • 语料库(corpus): 19,195 个文档(含标题和文本)
  • 查询(queries): 500 个查询文本
  • 测试对(test): 948 个查询-语料关联对(含相关性分数)
搜集汇总
数据集介绍
LongMemEvalDoc 数据集图片
构建方式
LongMemEvalDoc数据集专为评估大语言模型在长文本上下文中的记忆与检索能力而构建。其语料库(corpus)由19,195篇文档组成,每篇包含唯一标识符(_id)、标题(title)与正文(text),总数据量约200MB,覆盖多样化的长文本主题。查询集(queries)包含500个独立查询问题,每个问题同样具备唯一标识与文本描述。测试集(test)提供948条查询-文档关联对,通过分数(score)标注相关程度,形成标准的评测基准。数据集采用HuggingFace Datasets框架组织,划分为三个配置(corpus、queries、default),分别存储原始语料、查询及带标签的测试数据,便于模块化加载与评估。
特点
该数据集的核心特点在于聚焦长文本情境下的记忆挑战,语料库文档长度远超常规摘要或问答数据集,模拟真实场景中模型需处理的海量信息。查询与文档的关联并非简单匹配,而是基于语义相关性精心标注,测试集分数(0-3)量化了不同层级的检索难度。此外,数据集设计了独立查询与大规模语料库的分离结构,允许研究者灵活调整评估范式,例如仅使用部分语料或自定义查询。其规模适中(约200MB),避免了极端计算资源消耗,同时保持了对长上下文建模能力的有效区分度。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset函数便捷加载LongMemEvalDoc,指定配置名称('corpus'、'queries'或'default')以获取相应分片。典型用法是将语料库作为检索池,查询集作为输入,利用测试集中的标注计算模型在长文本匹配上的准确率、召回率或排序指标。为适配检索任务,建议将文档与查询编码为向量后计算相似度,或直接利用大语言模型的生成能力评估记忆召回表现。数据以分片(shard)形式存储(如corpus-*、test-*),支持流式加载以节省内存,适合在单GPU或分布式环境下复现长上下文评估实验。
背景与挑战
背景概述
LongMemEvalDoc数据集诞生于大语言模型长文本理解与记忆能力亟待评估的背景下,由相关研究团队构建,旨在系统性地考察模型对长篇文档的检索与推理能力。该数据集包含约1.9万篇文档构成的知识库、500条查询及948组标注的查询-文档匹配对,覆盖多样化主题,为学术界提供了首个面向长文档场景的细粒度记忆评估基准。其创建推动了长文本处理领域的发展,尤其促进了检索增强生成(RAG)技术的评测与优化,对理解模型在长上下文中的信息保持与利用机制具有重要影响。
当前挑战
该数据集面临的核心挑战在于解决长文档检索中语义匹配的细粒度难题,即模型需准确识别与查询高度相关的文档片段而非整体相似性,这对传统检索方法构成显著考验。构建过程中,挑战体现为高质量标注的获取:需确保每对查询-文档关系具有明确且唯一的相关性依据,避免模糊或歧义;同时,文档库的规模与内容多样性要求标注团队投入大量精力进行语义审核与一致性校验,以保障评估的公正性与可靠性。
常用场景
经典使用场景
LongMemEvalDoc数据集专为评估和提升长文本检索与问答系统而设计,其经典使用场景聚焦于长文档的语义匹配与信息检索。该数据集包含近两万篇长文档与五百条查询,每篇文档平均长度远超常规检索语料,旨在模拟学术论文、法律卷宗或技术报告等复杂文档环境下的真实检索需求,为长文本理解与记忆能力的量化评估提供了权威基准。
衍生相关工作
基于LongMemEvalDoc,研究者衍生出多项重要工作,包括长文档检索增强生成模型的评测框架、基于层次索引的长文本编码器改进方案,以及面向记忆持久化的动态缓存策略。这些工作不仅深化了对长文本语义压缩与高效检索的理解,也催生了面向法律、金融等垂直领域的专用检索系统,体现了该数据集从基础评测到应用落地的强大辐射效应。
数据集最近研究
最新研究方向
LongMemEvalDoc数据集聚焦于长文本检索与记忆评估的前沿探索,通过构建包含近两万篇文档的语料库及五百条查询实例,为大规模语言模型在复杂信息检索任务中的长距离依赖捕获能力提供了标准化测试基准。该数据集的设计呼应了当前人工智能领域对超长上下文理解的研究热潮,尤其是在处理法律文书、学术论文等专业场景时,模型需同时兼顾细粒度语义匹配与全局逻辑连贯性。其开创性的'查询-文档'配对架构不仅验证了高效检索算法的鲁棒性,更推动了检索增强生成技术在实际应用中的可靠性提升,为构建更精准的知识问答系统奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务