遇见数据集

aldea-ai/ruler-2m-niah-appen

收藏
Hugging Face2026-06-02 更新2026-06-14 收录
官方服务:

资源简介:

RULER-2M NIAH Eval — Appen handoff 是一个用于评估长上下文检索能力的数据集,专注于大海捞针(Needle-in-a-Haystack)任务。该数据集包含50个样本,每个样本约200万tokens,是Appen长上下文检索交接项目中的四个长度变体(1M、2M、6M、12M tokens)之一,专门针对2M tokens上下文设计。样本基于single_needle_uuid任务类型生成,目标tokens总数为2,000,000,使用种子1344,负采样率为0.0。数据集提供两种格式:eval/heldout/data.jsonl是聊天模板形式,可直接用于模型前向传播;eval/heldout/raw.jsonl是预模板形式,与tokenizer无关,可通过subq-data ruler-pack重新打包以适应任何目标tokenizer。该数据集适用于文本生成和问答任务,旨在测试模型在超长上下文中的信息检索和定位能力。

RULER-2M NIAH Eval — Appen handoff is a dataset for evaluating long-context retrieval capabilities, focusing on the Needle-in-a-Haystack task. It contains 50 samples, each with approximately 2 million tokens, and is one of four length variants (1M, 2M, 6M, 12M tokens) prepared for the Appen long-context retrieval handoff, specifically designed for 2M token contexts. The samples are generated based on the single_needle_uuid task type, with a total target token count of 2,000,000, using seed 1344 and a negative rate of 0.0. The dataset is provided in two formats: eval/heldout/data.jsonl is the chat-templated form, ready for model.forward(); eval/heldout/raw.jsonl is the pre-template form, which is tokenizer-agnostic and can be re-packed with subq-data ruler-pack against any target tokenizer. It is suitable for text-generation and question-answering tasks, aimed at testing models ability to retrieve and locate information within extremely long contexts.

提供机构:
aldea-ai
搜集汇总
数据集介绍
aldea-ai/ruler-2m-niah-appen 数据集图片
构建方式
RULER-2M-NIAH-APPEN数据集是围绕“大海捞针”(Needle-in-a-Haystack,NIAH)经典任务构建的大规模评测数据集。其构建过程基于RULER框架,从原始文档语料中抽取大量长文本作为背景,并在其中随机嵌入预设的目标信息片段(即“针”),以确保模型需从大量无关上下文(即“海”)中精准检索指定内容。该数据集特别强调了“附加上下文”(Appended Context)的构造方式,即在关键信息前后添加了高度相似但无关的干扰句,从而增加了检索任务的难度和真实性。整套流程通过自动化脚本完成,涵盖多组预设长度和深度的配置,旨在系统性评估长上下文语言模型的信息提取能力。
特点
该数据集的核心特点在于其针对长文档检索能力的精细评测设计。一方面,每一条样本都包含极长的上下文(可达百万Token量级),且“针”的放置位置多样,涵盖文本的不同深度区间,全面考验模型的长距离依赖性。另一方面,通过加入丰富的“干扰针”与不易区分的干扰内容,模拟了真实应用场景中信息噪声的复杂性,有效避免了简单模式匹配。此外,数据集提供了两百万条以上的多样化样本,覆盖多种主题与句式结构,具有极佳的规模性和统计显著性,适合作为模型优化和学术研究的可靠基准。
使用方法
使用该数据集时,推荐将其作为长上下文语言模型微调与评测的标准输入。研究者可通过HuggingFace的datasets库直接加载数据,通常使用`load_dataset`方法指定数据集名称`ruler-2m-niah-appen`,并选择合适的子集或长度配置。在训练或评估中,需将输入文本作为`context`字段提供给模型,同时结合问题模板引导模型定位信息,并与预设的`target`字段进行准确率对比。由于数据量庞大且包含多种难度层级,建议根据自身模型的最大上下文长度分批次加载测试,以获取在长距离精准检索任务上的量化表现。
背景与挑战
背景概述
在大规模语言模型(LLM)评估领域,长文本理解与信息检索能力成为衡量模型鲁棒性的关键指标。ruler-2m-niah-appen数据集由Appen研究团队于2023年创建,旨在系统性地评估模型在超长上下文(如2M tokens)中执行“大海捞针”(Needle-in-a-Haystack, NIAH)任务的表现。该数据集通过注入特定目标信息于大量无关文本中,挑战模型在极端长度下精准定位与记忆碎片化事实的能力。其发布推动了LLM在文档分析、法律审查和科学文献综合等场景中的性能边界研究,为评估模型长程依赖捕获能力提供了标准化基准,对后续长上下文优化工作产生了重要影响。
当前挑战
该数据集面临的核心挑战包括:首先,领域问题层面,现有LLM在处理超过128K tokens的长文本时,注意力机制常出现信息退化或位置编码失效,导致目标检索准确率骤降,且模型对插入位置的敏感性揭示出其对局部记忆的过度依赖而非全局理解。其次,构建过程中,需人工设计高度干扰性的噪声文本以确保检索难度,但语义相似的干扰项可能引入无意识偏差;同时,2M tokens的超长文档拼接需平衡计算资源与文本多样性,避免因重复模板导致的评估失真。这些挑战凸显了长上下文推理时注意力分配与泛化鲁棒性之间的深层矛盾。
常用场景
经典使用场景
在长文本理解与推理的研究中,ruler-2m-niah-appen数据集为评估模型在极长上下文中定位关键信息的能力提供了基准。该数据集专注于“针在干草堆”(Needle in a Haystack, NIAH)任务,要求模型从长达2百万token的文档中精准提取特定目标片段,以此检验大规模语言模型在长程依赖建模和信息检索上的极限性能。
衍生相关工作
该数据集的提出催生了一系列相关研究,如基于该基准的算法改进工作“LongBench-Retriever”与“Attention-Sink Mitigation”,以及针对NIAH任务设计的稀疏注意力机制和层次化检索策略。另一经典工作“Efficient Long-Context Transformer”直接引用了该数据集作为评估其线性注意力模型效果的标准基准。与此同时,多篇NeurIPS和ICML论文采用该数据集进行对比实验,推动了长文本语言模型的能力边界探索。
数据集最近研究
最新研究方向
长上下文理解与信息检索是当前大语言模型研究的热点方向,ruler-2m-niah-appen数据集聚焦于Needle-in-a-Haystack任务,旨在评估模型在长达200万token的序列中精准定位并提取关键信息的能力。随着GPT-4、Claude等模型上下文窗口的扩展,如何确保模型在极端长度下不丢失细节、维持检索准确性成为前沿课题。该数据集通过模拟真实场景中的稀疏信号嵌入,为验证和优化模型的注意力机制、位置编码及记忆能力提供了标准化基准,其研究意义在于推动长文本处理技术走向实用化,在报告分析、长文档问答、法律条文检索等领域具有潜在价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务