遇见数据集

M2PreserveEval

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

M²PRESERVEEVAL 数据集是用于评估文本简化中意义保留的实例级标注数据集,基于 M²PRESERVE 框架构建。数据集包含两个 JSONL 文件:M2PreserveEval_Completeness.jsonl 和 M2PreserveEval_faithfulness.jsonl,分别对应完整性和忠实性两个评估维度。每个实例包含原始文本(source)、简化文本(simplified)、从文本中提取的原子关键事实(keyFacts)、对齐决策(Alignment)、细粒度标签(Labels)以及最终评分(score)。完整性维度的标签包括 Connected、good deletion、bad deletion 和 Wrong Key Fact;忠实性维度的标签包括 Connected、elaboration、factual error 和 Wrong Key Fact。实例还标注了评估维度(dimension)、实例索引(instanceidx)、原始文本来源(sourceName)以及简化模型名称(System_Name)。数据集样本来源于 Cambridge Exams、ELG CEFR、OneStopEnglish 语料库以及 TSAR 2025 共享任务等多个公开数据集。该数据集适用于文本简化系统的意义保留评估任务。

M²PRESERVEEVAL is an instance-level annotated dataset for evaluating meaning preservation in text simplification, built upon the M²PRESERVE framework. The dataset consists of two JSONL files: M2PreserveEval_Completeness.jsonl and M2PreserveEval_faithfulness.jsonl, corresponding to the two evaluation dimensions of completeness and faithfulness. Each instance includes the original text (source), simplified text (simplified), atomic key facts extracted from the text (keyFacts), alignment decisions (Alignment), fine-grained labels (Labels), and a final score (score). Labels for the completeness dimension include Connected, good deletion, bad deletion, and Wrong Key Fact; labels for the faithfulness dimension include Connected, elaboration, factual error, and Wrong Key Fact. Instances are also annotated with the evaluation dimension (dimension), instance index (instanceidx), source of the original text (sourceName), and the name of the simplification system (System_Name). The dataset samples are derived from multiple public datasets, including Cambridge Exams, ELG CEFR, OneStopEnglish corpus, and the TSAR 2025 shared task. This dataset is suitable for evaluating the meaning preservation of text simplification systems.

提供机构:
Cardiff NLP
创建时间:
2026-08-29
原始信息汇总

M²PRESERVEEVAL 数据集概述

该数据集用于评估文本简化任务中的意义保留情况,基于 M²PRESERVE 框架构建,提供了实例级别的细粒度标注。每个实例包含原文、简化输出、提取的关键事实、对齐决策、细粒度标注标签及最终评分。

文件结构

数据集由两个 JSONL 文件组成,分别对应两个评估维度:

  • M2PreserveEval_Completeness.jsonl:评估简化文本对原文信息的完整性保留。
  • M2PreserveEval_faithfulness.jsonl:评估简化文本对原文信息的忠实性

每个 JSONL 行代表一个带标注的实例。

数据格式与字段说明

每个实例的结构化字段如下:

字段 描述
dimension 评估维度,取值为 completenessfaithfulness
instanceidx 实例索引。
sourceName 原始文本来源数据集的名称。
source 原始输入文本。
simplified 简化后的文本。
keyFacts 从文本中提取的原子性关键事实。在完整性维度中提取自原文;在忠实性维度中提取自简化文本。
System_Name 生成简化文本的模型名称。
score 针对该评估维度的最终得分。
Alignment 关键事实的二元对齐值。
Labels 每个关键事实的细粒度标签。完整性标签包括 Connectedgood deletionbad deletionWrong Key Fact;忠实性标签包括 Connectedelaborationfactual errorWrong Key Fact

来源数据集

数据集中的实例采样自以下四个来源:

搜集汇总
数据集介绍
M2PreserveEval 数据集图片
构建方式
M2PRESERVEEVAL数据集的构建根植于M2PRESERVE框架,旨在为文本简化中的语义保持提供细粒度的实例级评估。数据集整合了来自剑桥考试、ELG CEFR、OneStopEnglish语料库及TSAR 2025共享任务等多元来源的原始文本,并由多种简化模型生成对应的简化文本。构建流程严谨,首先从原始文本中提取关键事实原子,对于完整性维度,关键事实源自原始文本;对于忠实性维度,则源自简化文本。随后,评估者针对每个关键事实进行对齐决策和细粒度标签标注,最终综合得出该维度的整体评分。每个实例均以JSONL格式存储,包含维度、索引、来源、简化文本、关键事实、系统名称、得分、对齐向量及标签等字段,确保了数据的结构化和可解释性。
特点
M2PRESERVEEVAL数据集的核心特点在于其双维度评估设计,涵盖完整性与忠实性,分别对应文本简化中信息保留与事实一致性的关键要求。每个实例提供细粒度的对齐向量和标签,完整性标签包括‘Connected’、‘good deletion’、‘bad deletion’及‘Wrong Key Fact’,忠实性标签则包括‘Connected’、‘elaboration’、‘factual error’及‘Wrong Key Fact’,这些标签能够精确捕捉简化过程中的各类语义变化。此外,数据集汇集了多种来源和多个简化系统的输出,具有广泛的代表性,且涵盖英语考试文本、新闻语料等多样化的语言场景,为研究文本简化质量评估提供了丰富且细致的基准。
使用方法
M2PRESERVEEVAL数据集的使用灵活多样,主要面向自然语言处理研究者与开发者。用户可直接加载JSONL文件,依据‘dimension’字段筛选特定评估维度,利用‘source’与‘simplified’字段进行文本对比分析,借助‘keyFacts’、‘Alignment’和‘Labels’字段深入理解简化过程中的语义保留或偏差。该数据集既可作为基准测试集,用于评估文本简化模型在语义保持上的性能,也可用作训练数据,训练自动评估模型或分类器。此外,研究者可依据‘sourceName’和‘System_Name’字段进行跨源、跨系统的对比研究,探索不同语域和模型对简化质量的影响,从而推动文本简化评估技术的进步。
背景与挑战
背景概述
M2PRESERVEEVAL数据集由卡迪夫大学等研究机构于2025年创建,旨在评估文本简化中的意义保留能力。该数据集基于M2PRESERVE框架,提供了细粒度的实例级标注,包括关键事实提取、对齐决策和标签,以全面衡量简化文本的完整性与忠实度。其核心研究问题在于如何自动、精准地评估简化过程是否破坏了原始语义。该数据集的出现填补了现有文本简化评估基准在语义保留细粒度分析上的空白,对自然语言处理领域的文本简化研究具有重要推动作用。
当前挑战
该数据集面临的主要挑战包括:领域内文本简化评估的复杂性,涉及多维度(完整性与忠实度)的联合考量,以及关键事实的准确识别与对齐问题;构建过程中,需从多样化的源数据(如剑桥考试文本、TSAR共享任务数据)中选取代表性实例,并确保标注的一致性与准确性,还需处理不同简化模型输出的差异性,导致标注标准的统一困难。此外,评估方法需适应不同语言风格与难度级别,以实现客观、可复现的意义保留度量。
常用场景
经典使用场景
M2PreserveEval数据集专为评估文本简化中的意义保持而设计,其核心应用场景聚焦于两大维度——完整性与忠实性。研究者可利用该数据集对各类文本简化系统(如基于大语言模型的生成器)的输出进行细粒度、实例级的自动评估。通过提供的原子关键事实、对齐决策和细粒度标注标签,该数据集支持从多个角度剖析简化文本是否保留了原始信息的核心要素,从而成为检验简化算法语义保真度的基准工具。其结构化的JSON格式便于集成到评估流水线中,适用于系统开发、模型比较及参数调优等经典研究任务。
实际应用
在实际应用中,M2PreserveEval可用于教育和信息服务领域的文本简化系统质量监控。例如,针对非母语学习者或阅读障碍人群的简化工具,开发者可利用该数据集检验其输出是否无意中删除了关键知识点或引入了事实性错误,从而优化系统以生成既易读又信息完整的简化文本。此外,该数据集的多源采样(涵盖剑桥考试、CEFR分级语料等)使其适用于跨领域、多风格的场景,为内容本地化、自动摘要生成等实际任务提供了评估和校准的依据,有助于提升这些应用在真实场景中的可靠性和用户信任度。
衍生相关工作
围绕M2PreserveEval,可衍生出多项相关研究。基于其细粒度标注,学者可以开发新的无参考评估指标,通过训练回归模型预测意义保持分数,从而替代人工评价。其关键事实和对齐信息也能用于构建可解释的评估系统,以文本形式呈现简化过程中的信息保留或丢失情况。此外,该数据集可被用作数据增强或训练语料,指导简化模型在生成时显式地遵循关键事实,提升输出的语义忠实性。这些衍生工作共同拓展了文本简化评估的研究边界,促进了从粗粒度评分到细粒度诊断的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务