遇见数据集

aldea-ai/ruler-4m-niah

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

RULER-4M NIAH 评估数据集包含20个单针UUID(single_needle_uuid)保留样本,每个样本约400万个标记,用于基准测试长上下文检索。该数据集使用subq-data(来自github.com/subquadratic-ai/ruler-data-generator)生成,并使用phase4-vocab分词器(词汇量248,044)进行打包。

The RULER-4M NIAH evaluation dataset contains 20 single-needle UUID reserved samples, each with approximately 4 million tokens, designed for benchmarking long-context retrieval. This dataset was generated using subq-data (from github.com/subquadratic-ai/ruler-data-generator) and tokenized and packed with the phase4-vocab tokenizer, which has a vocabulary size of 248,044.

提供机构:
aldea-ai
搜集汇总
数据集介绍
aldea-ai/ruler-4m-niah 数据集图片
构建方式
RULER-4M NIAH数据集专为评估大型语言模型在超长上下文场景下的检索能力而设计,基于“大海捞针”范式构建。其构建过程依托subquadratic-ai开发的数据生成工具,每条样本包含约400万tokens,共计20条样本。所有样本均采用phase4-vocab分词器(词汇表大小248,044)进行预分词处理,以确保token分布的稳定性。数据生成时采用固定的seed 1344,并设定负样本率为0.0,即所有样本均包含有效的检索目标(single_needle_uuid),从而专注于度量模型在极长序列中的精确召回能力。最终数据以chat模板化的格式存储,便于直接输入模型。
特点
该数据集的核心特点在于其极端的长上下文长度——每条样本约400万tokens,实际中位数tokens为3,879,905(达目标的97%),为目前公开可用的最长上下文检索基准之一。样本数量虽仅20条,但每个样本均经过精心设计,包含唯一标识符的检索任务,可系统性地测试模型在接近百万级token序列中的信息定位能力。数据覆盖了单一检索点场景,排除了负样本干扰,使评估聚焦于模型对长距离依赖的捕获效率,为长上下文模型的开发提供了严苛且可重复的测试条件。
使用方法
该数据集以两种格式提供:预处理后的eval/heldout/data.jsonl文件已应用chat模板,可直接用于模型的forward()推理;eval/heldout/raw.jsonl保留了未模板化的原始形式,便于用户自定义预处理流程。同步提供的stats.json和raw_stats.json文件记录了样本的token统计信息。使用时,用户可将data.jsonl加载为对话列表,按标准生成式评估流程计算模型在每条样本中检索到目标(needle)的准确率。建议结合模型的分段注意力或长上下文优化策略进行测试,以评估其在400万token级别上的检索表现。
背景与挑战
背景概述
在自然语言处理领域,长上下文建模是近年来备受关注的研究方向,随着Transformer架构的演进,模型处理超长文本的能力成为衡量其性能的关键指标。RULER-4M NIAH评估数据集由Subquadratic AI团队于近期创建,专注于“大海捞针”(Needle-in-a-Haystack, NIAH)任务,旨在测试模型在约400万token的极长上下文中检索特定信息的能力。该数据集包含20个精心设计的样本,使用专属分词器进行打包,并确保样本长度与目标接近,为长上下文理解提供了高难度的标准化评估基准。其研究核心在于揭示现有模型在超长序列处理中的检索极限,推动更高效长上下文架构的发展,对评估和改进诸如稀疏注意力、记忆增强等技术的实际效果具有重要价值。
当前挑战
RULER-4M NIAH所解决的领域核心挑战在于当前模型在处理百万级别token上下文时的检索准确率极度衰减,传统注意力机制受限于二次复杂度,无法有效利用超长序列中的遥远信息。构建过程中面临的核心困难包括:生成语义连贯且目标明确的400万token级样本,同时确保“针”的插入位置随机多样,避免引入偏移偏差;需精确控制样本长度以达到99%以上的目标token数,这对数据生成流水线的稳定性和高效性提出严苛要求;此外,保持评估结果的统计可靠性,在仅有20个样本的情况下平衡任务难度与泛化能力,也是设计时需克服的显著障碍。
常用场景
经典使用场景
在长上下文语言模型的评估领域,RULER-4M NIAH 数据集以其独特的“大海捞针”(Needle-in-a-Haystack)测试范式而著称。该数据集精心设计了20个保留样本,每个样本包含约400万tokens的上下文长度,专门用于评测模型在极长文本中精准检索特定信息的能力。研究者通过嵌入唯一标识符(single_needle_uuid)作为检索目标,模拟了在浩瀚信息海洋中定位关键细节的严苛场景,从而系统性地揭示模型在处理超长序列时的注意力分配与记忆回溯瓶颈。这一设计使其成为当前长上下文基准测试中不可或缺的标杆工具。
衍生相关工作
作为RULER评估套件的重要组成部分,该数据集催生了一系列开创性研究。其姐妹数据集RULER-12M-SFT进一步将上下文扩展至1200万tokens,探索模型在更极端尺度下的表现。在方法层面,研究者基于该数据集的检索任务验证了Ring Attention、YaRN等位置编码改进方案的实际增益,并衍生出针对长文档的混合记忆模型,如将检索增强生成(RAG)与压缩缓存技术相结合的方法。此外,该数据集的生成工具ruler-data-generator已被广泛复用,推动了如LongBench、L-Eval等基准的上下文长度拓展,形成了长上下文评估标准化的生态链。
数据集最近研究
最新研究方向
该数据集聚焦于长上下文场景下的信息检索能力评估,特别是针对4M token级别的超长序列中单点信息(needle-in-a-haystack)的提取任务。随着大语言模型上下文窗口的不断扩展,如何精准衡量模型在极长文本中的记忆与定位能力成为前沿热点。RULER-4M NIAH通过精心设计的20个样本,每个样本包含约400万token,为评估模型在极端长度下的检索鲁棒性提供了标准化基准。这一研究方向直接关联到当前AI领域对高效长文本理解与推理的迫切需求,对于推动模型在文档分析、代码库检索、科学研究等需要处理海量信息的场景中落地具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务