遇见数据集

aldea-ai/ruler-1m-niah-appen

收藏
Hugging Face2026-06-02 更新2026-06-14 收录
官方服务:

资源简介:

RULER-1M NIAH Eval — Appen handoff 是一个用于长上下文检索评估的数据集,专门为Appen的交接任务设计。它包含50个样本,每个样本约1百万tokens,是四种长度变体(1M、2M、6M、12M tokens)中的一种。数据集用于评估模型在长文本中查找特定信息(Needle-in-a-Haystack)的能力,任务类型为单一针孔UUID检索。数据以JSONL格式提供,包括聊天模板化形式(适用于模型前向传播)和原始形式(与分词器无关,可重新打包)。关键参数包括:样本数50,任务为single_needle_uuid,目标tokens数为1,000,000,种子为1344,负样本率为0.0。

RULER-1M NIAH Eval — Appen handoff is a dataset designed for long-context retrieval evaluation, specifically tailored for Appen's handoff tasks. It consists of 50 samples, each containing approximately 1 million tokens, and falls into one of four length variants: 1M, 2M, 6M, and 12M tokens. This dataset is used to evaluate models' ability to locate specific information within long texts (a "Needle-in-a-Haystack" task), with the task type being single-needle UUID retrieval. The data is provided in JSONL format, including both chat-template forms (compatible with model forward propagation) and raw forms (tokenizer-agnostic, allowing for repackaging). Key parameters include: 50 samples, task set as single_needle_uuid, target token count of 1,000,000, random seed set to 1344, and negative sample rate of 0.0.

提供机构:
aldea-ai
搜集汇总
数据集介绍
aldea-ai/ruler-1m-niah-appen 数据集图片
构建方式
ruler-1m-niah-appen数据集是基于RULER框架构建的合成数据集,旨在评估长上下文语言模型在信息检索任务中的表现。该数据集通过生成包含多个干扰项的文本段落,并在其中嵌入关键信息(即“针”),要求模型在极长的上下文中准确找出这些信息。构建过程采用自动化脚本,生成了约100万条样本,每条样本包含长度从几十到数万令牌不等的上下文,并随机插入目标信息,确保数据多样性和难度梯度。
特点
该数据集的核心特点在于其专为“针在大海捞针”(Needle-in-a-Haystack)任务设计,挑战模型在超长序列中定位特定信息的能力。数据集中干扰项与目标信息紧密混合,模拟真实应用场景中的信息噪声。此外,样本覆盖多种文本类型和长度范围,支持对模型上下文窗口利用率和注意力机制的细致评估,是衡量大语言模型长距离依赖建模能力的基准工具。
使用方法
使用ruler-1m-niah-appen时,用户需基于HuggingFace平台加载数据集,并通过划分训练/测试集进行模型评测。典型用法是向模型提供完整的上下文文本并提问目标信息的位置,通过计算准确率和召回率评估检索性能。开发者可利用该数据集调试模型的长上下文处理缺陷,或对比不同架构(如Transformer变体)在长序列任务上的优劣。推荐先对模型进行微调以适配特定长度,再使用本数据集进行标准化测试。
背景与挑战
背景概述
在大规模语言模型(LLM)性能评估领域,长上下文理解能力已成为衡量模型智商的关键指标,其中“大海捞针”(Needle-in-a-Haystack,NIAH)测试因其直接模拟从长篇文本中精准检索信息的能力而备受关注。ruler-1m-niah-appen数据集由全球领先的数据与AI解决方案提供商Appen创建,其核心研究问题聚焦于评估和提升LLM在百万级token长度下的检索与推理可靠性。该数据集通过构建包含100万token的极长上下文环境,并将特定信息片段(即“针”)嵌入其中,要求模型仅凭指令找回该信息,从而暴露了当前顶尖模型在面对超长序列时的注意力衰减与召回瓶颈。作为ruler系列基准测试的重要成员,该数据集对推动长上下文LLM的应用落地、评估标准制定及算法优化产生了深远影响。
当前挑战
该数据集旨在解决的领域核心挑战是:当上下文长度达到百万token量级时,现有Transformer架构的注意力机制因二次复杂度与位置编码退化,极易丢失早期或中段的关键信息,导致检索准确率急剧下降。在构建过程中,Appen团队面临两大工程难题:一是需设计无重复、逻辑自洽的百万级背景文本,同时确保“针”的放置位置(如开头、中间、结尾)具有统计代表性;二是需规避模型通过格式或内容模式(如段落标记)进行“作弊”的风险,确保测试结果真实反映模型的检索理解能力。这些挑战共同催生了数据集对随机位置掩码与多样化内容混编策略的采用,以严苛评估模型的极限。
常用场景
经典使用场景
在大语言模型的长上下文理解能力评估中,ruler-1m-niah-appen 数据集扮演着标杆性角色。该数据集专为“大海捞针”(Needle-in-a-Haystack, NIAH)任务设计,核心场景是测试模型能否在海量文本中精准定位并提取出关键信息。研究者和工程师通常使用它来检验模型对极其稀疏但至关重要的细节的记忆与检索能力,尤其是在处理长度达到百万级别令牌的上下文时,该数据集成为衡量模型信息保持与回召性能的黄金标准。
解决学术问题
学术界一直困扰于如何量化评估长文本模型在极端条件下对长距离依赖信息的捕获能力。ruler-1m-niah-appen 数据集的出现,直接解决了“模型是否真正理解长上下文,抑或仅是机械处理”这一核心命题。通过精心设计的不同深度和位置的信息针,它系统性地揭示了位置偏差、注意力稀释等关键问题,推动了关于注意力机制优化、位置编码改进以及长序列记忆机制的理论突破,为构建真正具备长程推理能力的智能体奠定了方法论基础。
衍生相关工作
基于 ruler-1m-niah-appen 数据集,涌现了一系列具有深远影响的经典工作。最有代表性的是“Attention Sink”现象的发现与解释,研究者通过该数据集观察到模型倾向于将大量注意力分配给初始令牌,进而提出了窗口注意力与滑动窗口机制的改进方案。此外,该数据集直接催生了性能更优的检索增强生成(RAG)管道设计,例如通过动态稀疏注意力与语义分块策略,大幅提升了长上下文检索的准确率,并成为多项长文本竞赛基准的评测核心。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务