遇见数据集

mit-oasys/oolong-pairs

收藏
Hugging Face2026-06-01 更新2026-06-14 收录
官方服务:

资源简介:

Oolong-Pairs是一个基于长上下文的成对聚合推理基准,构建在oolongbench/oolong-synth数据集之上。每个任务提供一个包含数千个一般知识问题的长上下文(每行一个问题,每个问题附有一个非唯一的用户ID)。每行可以隐含地标记为六个TREC粗粒度类别之一——描述和抽象概念、实体、人类、数值、位置、缩写——模型必须计算用户对的精确聚合统计信息(例如,列出所有至少有一个数值或位置实例的用户对)。标签从未给出;必须从每行的语义中推断。

Oolong-Pairs is a long-context, pairwise-aggregation reasoning benchmark built on top of the oolongbench/oolong-synth dataset. Each task presents a long context of thousands of general-knowledge questions (one per line, each attached to a non-unique User ID). Every line can be implicitly labelled with one of six TREC coarse categories — description and abstract concept, entity, human being, numeric value, location, abbreviation — and the model must compute exact aggregate statistics over pairs of users (e.g. list all pairs of users who both have at least one numeric-value or location instance). The labels are never given; they must be inferred from the semantics of each line.

提供机构:
mit-oasys
搜集汇总
数据集介绍
mit-oasys/oolong-pairs 数据集图片
构建方式
Oolong-Pairs是构建于oolongbench/oolong-synth数据集之上的长上下文成对聚合推理基准。该基准从oolong-synth的trec_coarse验证集中提取数千行通用知识问题,每行附带非唯一的用户ID和隐含的TREC粗粒度类别标签(如描述与抽象概念、实体、人类、数值、位置、缩写)。模型需从问题语义中自行推断这些从未显式给出的标签。构建过程中,针对不同上下文长度(从1024到1,048,576个token不等),计算满足特定条件的用户ID对(如“列出所有至少有一个数值或位置实例的用户对”),并将结果存储为精确的成对答案集合。完整的答案集因规模巨大(1M token文件可达1.7 GB)而以单独JSON文件形式提供,HuggingFace数据集查看器中仅展示问题模板和配对摘要信息。
特点
该数据集的核心特点在于其极长的上下文规模与组合爆炸式的答案复杂度。它覆盖11种上下文长度,最长可达一百万个token,某些问题的有效用户ID对数量高达数百万,对模型的记忆、语义理解和精确聚合能力构成严峻考验。与传统基准不同,Oolong-Pairs不提供显式标签,迫使模型必须依赖上下文中的语义线索进行推理。查询类型聚焦于跨用户对的条件统计,强调关系推断而非单点事实检索。此外,数据集将问题与上下文分离存储,确保评估的灵活性,而答案的排序格式(id1<id2)和去重设计保证了评测的一致性与公平性。
使用方法
使用Oolong-Pairs进行模型评估需遵循特定流程。首先,需从HuggingFace下载对应上下文长度的JSON文件获取问题与标准答案。其次,必须从oolong-synth数据集的validation分割中加载相同上下文长度的trec_coarse上下文文本(不含标签)。随后,将上下文文本与问题拼接构建提示,要求模型以(id1, id2)格式(第一ID排序,id1<id2)返回用户对集合。最终,将模型输出与JSON文件中的gold答案集合进行精确匹配比较。由于上下文文本与答案集分别存储,评估前需确保上下文长度一致,并注意仅使用验证集中的trec_coarse样本以保证基准的纯净性。
背景与挑战
背景概述
Oolong-Pairs数据集由麻省理工学院的研究团队于2025年创建,源自递归语言模型(RLM)研究工作,旨在评估大语言模型在超长上下文场景下的成对聚合推理能力。该数据集构建于Oolong基准之上,通过将数千条通用知识问题附加至非唯一用户ID,要求模型隐式推断每条文本的TREC粗粒度类别(如描述与抽象概念、实体、人类、数值、位置、缩写),并计算用户对上的精确聚合统计量。其核心研究问题在于检验模型能否在缺乏显式标签的条件下,从海量上下文中自主提取语义类别并完成跨用户对的逻辑聚合。Oolong-Pairs的提出为长上下文推理领域提供了具有挑战性的标准化评估工具,显著推动了递归语言模型与聚合推理能力的研究边界。
当前挑战
该数据集所解决的领域挑战聚焦于长上下文场景下的隐式推理与聚合计算:传统模型在数千token的上下文中难以同时完成语义分类与跨条目统计,而Oolong-Pairs要求模型自主推断标签并输出精确用户对集合,这对模型的全局感知与组合推理能力构成严峻考验。在构建过程中,研究团队面临的主要挑战包括:1)答案集随上下文长度呈组合爆炸式增长,1M-token文件包含约7200万对有效用户对,导致存储与计算开销巨大;2)需确保不同上下文长度下答案的绝对精确性,且每对用户必须满足严格排序条件(id1<id2);3)基准测试依赖外部oolong-synth数据集提供无标签上下文,需设计统一评估流程以避免数据泄露。
常用场景
经典使用场景
Oolong-Pairs数据集专为评测大语言模型在超长上下文(可达百万token)下的成对聚合推理能力而设计。其经典使用场景是向模型输入包含数千条通用知识问题(每行附有用户ID)的长文本,要求模型在隐式推断每条文本的TREC粗粒度语义类别(如描述与抽象概念、实体、人类、数值、地点、缩写)后,精确计算任意两个用户之间的聚合统计量,例如找出所有“至少包含一个数值或地点实例”的用户对。该过程需模型同时具备长距离语义理解、隐式类别标注和集合运算三重能力。
解决学术问题
该数据集直击当前长上下文评估中缺乏复杂聚合推理任务的痛点,解决了如何系统性地衡量模型在超长序列中执行多步逻辑归纳与精确统计计算的问题。传统评测多聚焦于检索或简单问答,而Oolong-Pairs通过要求模型在无显式标签的条件下自主完成从语义解析到成对聚合的完整推理链条,揭示了模型在信息整合与符号化计算方面的真实瓶颈。其意义在于为长上下文推理研究提供了首个标准化、可扩展的成对聚合测试基准,推动学界关注超越信息定位的高阶认知任务。
衍生相关工作
Oolong-Pairs作为Oolong基准的扩展,直接催生了递归语言模型(RLM)这一代表性工作的发展,RLM论文将其作为核心评测集以展示递归式推理相比直接处理长文本的优越性。此外,该数据集启发了对长上下文模型中隐式类别推理能力的深入探究,推动了相关研究者在提示工程、记忆增强架构和符号化接口设计等方向提出创新方案。其衍生的评估方法论也被后续工作借鉴,用于构建更复杂的多跳聚合和跨文档推理基准,形成了以Oolong体系为核心的长上下文聚合推理研究脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务