遇见数据集

jsaj-eval-bundle

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

JSAJ Eval Bundle 是一个用于评估长上下文模型在上下文退化条件下性能的预构建数据集,源自MMLongBench-Doc数据集。该数据集由JSAJ团队在Algoverse 2026年3月队列研究中创建,专门用于研究长上下文模型的退化问题。数据集包含286个核心问题,每个问题在五种不同的干扰条件下生成评估单元:控制条件(仅源文档)、包含2个或4个主题相关硬干扰文档的条件,以及包含2个或4个随机干扰文档的条件。每个评估单元由一个源PDF文档、若干干扰PDF文档和一个包含元数据的question.json文件组成。源文档始终位于位置0。数据集总计包含1,430个评估单元,每个单元具有唯一的cell_id标识。元数据包括文档ID、问题文本、参考答案、答案格式、干扰条件类型、干扰文档数量、总页数、估计token数量以及文件名映射。干扰文档的选择是确定性的,基于种子20260523,确保不同模型评估时单元内容完全一致。数据集结构清晰,包含按问题编号组织的文件夹层级和用于批量处理的manifest.json文件。该数据集适用于问答系统在多文档、长上下文PDF处理任务中的性能评估,特别是在存在上下文干扰或退化场景下的鲁棒性测试。

JSAJ Eval Bundle is a pre-built dataset for evaluating the performance of long-context models under contextual degradation conditions, derived from the MMLongBench-Doc dataset. It was created by the JSAJ team in the Algoverse March 2026 cohort study, specifically designed to study degradation issues in long-context models. The dataset contains 286 core questions, each generating evaluation units under five different interference conditions: control condition (source document only), conditions with 2 or 4 topic-related hard interference documents, and conditions with 2 or 4 random interference documents. Each evaluation unit consists of a source PDF document, several interference PDF documents, and a question.json file containing metadata. The source document is always at position 0. The dataset totals 1,430 evaluation units, each with a unique cell_id identifier. Metadata includes document ID, question text, reference answer, answer format, interference condition type, number of interference documents, total page count, estimated token count, and filename mapping. The selection of interference documents is deterministic, based on seed 20260523, ensuring that unit content remains consistent across different model evaluations. The dataset has a clear structure, including folder hierarchies organized by question numbers and a manifest.json file for batch processing. It is suitable for evaluating the performance of question-answering systems in multi-document, long-context PDF processing tasks, especially for robustness testing in scenarios with contextual interference or degradation.

创建时间:
2026-05-25
原始信息汇总

数据集概述

数据集名称:JSAJ Eval Bundle

许可证:Creative Commons Attribution 4.0 International (CC-BY-4.0)

任务类别:问答(question-answering)

标签:上下文退化(context-degradation)、长上下文(long-context)、多文档(multi-document)、PDF

数据规模:样本数量在 1,000 到 10,000 之间

数据集来源

本数据集源自 MMLongBench-Doc,经过 286 行文本安全过滤后衍生而来。源 PDF 和强负面(Hard Negative)PDF 最初在数据集 luoojason/mmlongbench-text-only 中整理。

数据集用途

用于 JSAJ 团队在基于 MMLongBench-Doc 的数据集上进行上下文退化评估的预材料化单元。每个单元格文件夹包含评估必须使用的精确 PDF 文件。

数据结构

数据集包含 286 个问题,每个问题有 5 种条件设置,共组成 1,430 个单元格。源 PDF 始终位于位置 0。

目录结构如下:

q0/ control_k0/ source.pdf + question.json hard_negative_k2/ source.pdf + hn_1.pdf + hn_2.pdf + question.json hard_negative_k4/ source.pdf + hn_1.pdf .. hn_4.pdf + question.json random_k2/ source.pdf + random_1.pdf + random_2.pdf + question.json random_k4/ source.pdf + random_1.pdf .. random_4.pdf + question.json q1/ ... manifest.json cell_id -> folder path lookup

单元格类型

  • control_k0:仅包含源文档。
  • hard_negative_k2 / k4:包含源文档加上 2 或 4 个按问题精选的主题强负面 PDF。
  • random_k2 / k4:包含源文档加上从其他问题中采样的 2 或 4 个强负面 PDF(每个其他问题提供一个强负面 PDF,从不从源问题自身的强负面池中选取)。

干扰项的选择是确定性的,种子为 20260523。所有使用该数据集的模型将得到字节完全一致的单元格。

每个单元格的元数据

每个单元格文件夹中的 question.json 包含以下字段:

  • cell_id:单元格标识符(例如 "q0_random_k4")
  • doc_id:源文档 ID
  • question:问题内容
  • answer:答案内容
  • answer_format:答案格式(例如 "Str")
  • condition:条件类型(例如 "random")
  • k:干扰项数量
  • n_pages:相关 PDF 的总页数
  • est_tokens:估计的 token 数量
  • bundle_filenames:单元格内所有 PDF 文件名列表
  • original_filenames:原始 PDF 文件名列表

使用方法

加载单个单元格:

python import json from pathlib import Path

cell = json.load(open("q0/random_k4/question.json")) pdfs = [Path(f"q0/random_k4/{name}") for name in cell["bundle_filenames"]]

将 pdfs 和 cell["question"] 输入模型,根据 cell["answer"] 评分

对于批量评估,可遍历 manifest.json 获取所有单元格文件夹路径。

引用

本数据集是 JSAJ 团队在 Algoverse 2026 年 3 月队列中关于长上下文退化研究的一部分。相关代码仓库:SaibililaA/JSAJ

搜集汇总
数据集介绍
jsaj-eval-bundle 数据集图片
构建方式
JSAJ Eval Bundle 数据集专为评估长上下文语言模型在信息检索中的性能退化现象而设计,源自 MMLongBench-Doc 数据集,经过文本安全过滤后保留了286个问答对。每个问答对衍生出五种实验条件:仅包含源文档的对照组(control_k0)、插入2或4篇同主题强负例文档的 hard_negative 组、以及插入2或4篇从其他问题随机采样的干扰文档的 random 组。干扰文档的选择采用确定性种子(20260523)以确保可复现性,总计形成1,430个独立评测单元。
特点
该数据集的核心特色在于其精细的结构化评测设计。每个评测单元以独立文件夹形式组织,内含源 PDF、干扰 PDF 及一个标准化的 question.json 文件,记录细胞编号、文档来源、问题、答案、条件类型、干扰数、页数与预估 token 数等信息。通过控制干扰文档的主题相关性与数量,数据集能够系统性地度量模型在逐渐增加的外部噪声下对关键信息定位能力的衰减程度,且所有细胞均保持字节一致性,适用于跨模型的公平对比。
使用方法
使用该数据集时,研究者可从任意评测单元的文件夹中读取 question.json 获取问题与答案,并通过 bundle_filenames 字段获取需要加载的 PDF 文件路径列表,将其与问题一同输入模型进行推理。批量评测可通过解析 manifest.json 获取全部细胞路径,循环执行上述流程。模型输出后与答案进行比对以计算得分,从而评估模型在不同干扰条件下的表现。相关代码与详细流程可见 JSAJ 团队的开源仓库。
背景与挑战
背景概述
随着多文档问答与长上下文理解技术的快速发展,现有评测基准多聚焦于模型对长文本的绝对记忆能力,而鲜有系统评估上下文干扰对模型性能的退化效应。在此背景下,JSAJ团队于2026年基于Algoverse研究计划创建了jsaj-eval-bundle数据集,旨在量化长上下文场景中引入无关或语义相似文档后,模型回答准确性的衰减幅度。该数据集由MMLongBench-Doc筛选的286个问答对衍生而来,每个问题被组织为5种干扰条件(无干扰、2/4篇强语义负样本、2/4篇随机负样本),共计1430个评测单元。通过严格固定PDF来源与文档顺序,确保跨模型评测的可复现性,为长上下文鲁棒性研究提供了标准化分母。
当前挑战
该数据集主要应对两大挑战:一是领域内长期存在的‘上下文退化’问题,即当输入文本长度超出模型有效处理窗口时,无关或竞争性信息会显著抑制模型对目标信息的提取能力,现有模型在此类细粒度多文档场景中的表现仍不明确;二是构建过程中如何平衡负样本的语义关联度与随机性,团队通过为每个问题手工筛选领域相关文档(硬负样本)与跨问题随机采样(随机负样本),并采用确定性种子(20260523)确保实验可复现,但此类人工标注的依赖性与大规模扩展时的成本仍需克服。
常用场景
经典使用场景
长上下文模型在真实文档理解任务中常面临上下文退化问题,即随着输入长度的增加,模型对关键信息的提取能力显著下降。jsaj-eval-bundle数据集正是为系统评估这一现象而精心设计的。该数据集以MMLongBench-Doc为基础,精选286个问答对,每个问题构建五种条件单元格:无干扰的控制组、包含2或4篇主题强相关硬负样本的挑战组,以及同等数量但随机采样的干扰组。通过对比模型在不同干扰强度和类型下的表现,研究者能够精准量化上下文退化程度及其对答案质量的影响。这一设计使得该数据集成为评测长上下文模型鲁棒性的经典标杆。
衍生相关工作
基于该数据集的构造范式,JSAJ团队在Algoverse 2026春季队列中开展了一系列影响深远的研究工作。这些工作探索了多层级硬负样本筛选策略,证实了基于语义相似度的干扰文档能更有效地暴露模型弱点。后续衍生工作进一步细化了上下文退化的梯度分析,开发了自动化退化检测指标,并探索了将评估结果反馈至模型训练阶段的数据增强方法。此外,该数据集的确定性生成机制(固定随机种子与字节一致性)使不同模型间的公平对比成为可能,启发了多项关于评估去偏差和消融分析方法的研究,推动了长上下文评测框架的标准化进程。
数据集最近研究
最新研究方向
当前,长上下文推理中的信息衰减问题成为大语言模型应用的核心瓶颈。jsaj-eval-bundle数据集正是为系统性地量化与诊断这一‘上下文退化’现象而构建,其通过精细化的对照实验设计(如控制干扰项类型与数量),为模型在长文档、多PDF环境下的事实保持能力提供了标准化评估框架。该数据集来源于MMLongBench-Doc并经过纯文本筛选,结合JSAJ团队在Algoverse 2026年度研究中揭示的模型对结构化干扰的脆弱性,相关成果不仅推动了长上下文建模的基准建设,更为实现可靠的多文档问答系统奠定了关键评测基础,具有显著的实践指导意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务