遇见数据集

UniversalCEFR/ComplexityMT

收藏
Hugging Face2026-06-05 更新2026-06-14 收录
官方服务:

资源简介:

ComplexityMT是一个基准数据集,用于研究文本复杂度(通过欧洲共同语言参考框架(CEFR)操作化)与机器翻译之间的交互作用。该数据集包含来自五个机器翻译系统的输出,这些输出翻译了涵盖所有六个CEFR级别(A1至C2)的文本,涉及六种语言,同时提供了无参考翻译质量分数(COMET-22、GEMBA-DA)以及前后向翻译输出的CEFR分类器读数。数据集支持两个互补任务:任务1(鲁棒性)研究源文本复杂度是否影响翻译质量;任务2(保持性)研究机器翻译是否保持源文本的CEFR水平。数据集覆盖的语言包括阿拉伯语、荷兰语、英语、法语、印地语和俄语。MT系统包括GPT-5.4、Google Translate、TranslateGemma 4B、TranslateGemma 12B和Tower-Instruct 7B。数据集结构包括任务1和任务2的配置,每个配置有句子和文档分割,数据字段包括源语言、目标语言、CEFR级别、翻译文本、质量分数等。创建数据集的目的是评估机器翻译系统在保持源文本教学复杂度方面的表现,源数据来自UniversalCEFR集合,注释包括人类标注的黄金CEFR标签、自动翻译质量分数和CEFR分类器读数。

ComplexityMT is a benchmark dataset for investigating the interplay between text complexity (operationalized via the Common European Framework of Reference for Languages, CEFR) and machine translation. This dataset contains outputs from five machine translation systems, which translated texts spanning all six CEFR proficiency levels (A1 to C2) across six languages. It also provides reference-free translation quality metrics (COMET-22, GEMBA-DA) and CEFR classifier scores for forward and backward translation outputs. The dataset supports two complementary tasks: Task 1 (Robustness) investigates whether source text complexity impacts translation quality; Task 2 (Retention) examines whether machine translation preserves the CEFR proficiency level of the source text. The languages covered in the dataset include Arabic, Dutch, English, French, Hindi, and Russian. The MT systems included are GPT-5.4, Google Translate, TranslateGemma 4B, TranslateGemma 12B, and Tower-Instruct 7B. The dataset structure includes configurations for Task 1 and Task 2, each with sentence-level and document-level splits. The data fields include source language, target language, CEFR proficiency level, translated text, quality metrics, and more. The dataset was created to evaluate machine translation systems' performance in preserving the pedagogical complexity of source texts as defined by their CEFR levels. The source data originates from the UniversalCEFR collection, and the annotations include human-annotated gold-standard CEFR labels, automatic translation quality metrics, and CEFR classifier scores.

提供机构:
UniversalCEFR
搜集汇总
数据集介绍
UniversalCEFR/ComplexityMT 数据集图片
构建方式
ComplexityMT的构建根植于对机器翻译系统在文本复杂度维度上表现的系统性评估需求。研究团队从UniversalCEFR语料库中选取了经专业标注者人工标注CEFR等级(A1至C2)的多语种文本作为源材料,涵盖阿拉伯语、荷兰语、英语、法语、印地语和俄语六种语言。随后,利用五种代表性的机器翻译系统(包括GPT-5.4、Google Translate、TranslateGemma 4B、TranslateGemma 12B及Tower-Instruct 7B)对这些文本执行前向翻译,并进一步构建完整的往返翻译流程。针对任务一,借助COMET-22与GEMBA-DA两种无参考评估指标自动赋予翻译质量分数;针对任务二,则加载统一CEFR分类器对源文本、前向译文及回译文本分别进行等级预测,由此系统性地捕捉复杂度与翻译质量间的交互关系。
特点
该数据集的核心特色在于其双任务互补设计及精细的多粒度覆盖。任务一聚焦于源文本复杂度对翻译质量的鲁棒性影响,揭示了高CEFR等级文本在多数语言对及系统中系统性地获得较低质量译文的规律。任务二则衡量机器翻译对原文复杂度等级的保持能力,研究发现文档级别的回译会导致平均约0.16至0.31个CEFR等级的下降。数据集同时提供了句子与文档两种粒度,并附带了五个主流翻译系统的完整输出及多种自动评估分数,使得研究者能够在统一框架下同时分析复杂度效应的语言间差异、系统间差异与粒度间差异。源文本的人类标注CEFR等级与XLM-R分类器读数相结合,亦为多语言复杂度分类任务的进一步探索奠定了基础。
使用方法
ComplexityMT通过HuggingFace Datasets库直接加载,暴露了两个配置项(task1_robustness与task2_preservation),每个配置均包含sentence与document两个子集。用户可使用load_dataset函数指定配置名与拆分名称即可快速获取结构化数据。任务一的数据字段包含源文本、译文、CEFR等级及COMET-22与GEMBA-DA分数,适合用于训练复杂度感知的翻译质量评估模型。任务二的数据则提供完整的往返翻译记录及CEFR分类器在各环节的预测值,可直接用于计算模型锚定偏移与黄金偏移,从而量化翻译过程中的复杂度保持或漂移。对于需要直接处理原始JSON文件的用户,可通过传递field='results'参数提取记录,以便进行更灵活的数据探索与自定义分析。
背景与挑战
背景概述
ComplexityMT数据集的诞生源于机器翻译领域对文本复杂度与翻译质量之间交互作用的系统性探究。由Imperial等人于2026年发布,该数据集汇聚了来自多所研究机构的学者,包括Joseph Marvin Imperial、Junhong Liang等,旨在填补现有机器翻译基准中缺乏对源文本教学复杂度(CEFR等级)考量这一空白。数据集覆盖阿拉伯语、荷兰语、英语等六种语言,并整合了五种主流机器翻译系统的输出,通过鲁棒性与保持性两大任务,系统性地评估文本复杂度如何影响翻译质量及等级保持。ComplexityMT不仅为翻译质量评估提供了新的维度,更推动了多语言、多粒度文本复杂度分析的研究范式变革,对自然语言处理领域具有深远影响。
当前挑战
该数据集所面临的挑战兼具领域问题与构建复杂性。领域层面,传统机器翻译基准侧重于语义忠实度与流畅性,未能衡量翻译是否保留了源文本的难度等级,ComplexityMT旨在解决这一评估维度缺失问题,为教育等需要精确难度匹配的场景提供标准参照。构建过程中,数据集需要处理多语言文本在CEFR标签上的标注一致性难题,不同语种的分类器存在读数偏移,需通过多种分类器交叉验证;同时,源文本许可条款各异,在遵守CC BY-NC-SA 4.0协议的前提下,还需兼顾数据规模与翻译质量的平衡,以及闭源模型输出结果的合规发布等挑战。
常用场景
经典使用场景
ComplexityMT作为一项开创性基准,其最经典的使用场景在于系统评估机器翻译系统在面对不同语言复杂度文本时的表现。具体而言,该数据集基于欧洲共同语言参考框架(CEFR)的六个等级(A1至C2),覆盖阿拉伯语、荷兰语、英语、法语、印地语和俄语六种语言,并包含GPT-5.4、Google Translate等五种主流机器翻译系统的输出。研究者可以通过该数据集,深入探究源文本复杂度如何影响翻译质量,以及翻译过程是否能够保留源文本的CEFR等级,从而为机器翻译系统的复杂度鲁棒性和语言层级保真度提供量化衡量标准。
解决学术问题
该数据集精准解决了传统机器翻译评估中忽视语言复杂度这一关键维度的学术缺憾。在经典的机器翻译评测任务里,语义忠实度和流畅性往往占据主导地位,而文本的教育学术难度或语言复杂度却被长期忽略。ComplexityMT通过引入CEFR框架,首次系统性地揭示了高复杂度源文本在不同机器翻译系统中普遍获得更低质量翻译的现象,同时量化了前向翻译与回译过程中CEFR等级的偏移量。这一成果为翻译质量评估研究开辟了新的分析视角,促使学界关注机器翻译在语言教育、文本分级等场景中的潜在局限。
衍生相关工作
围绕ComplexityMT衍生的相关工作主要聚焦于语言复杂度感知的翻译评估、跨语言CEFR分类器优化以及翻译系统的复杂度鲁棒性提升。该基准的发布直接推动了多项后续研究,包括基于COMET-22和GEMBA-DA指标的复杂度条件翻译质量预测模型开发,以及利用数据集中标注的CEFR分类器预测值进行多语言文本复杂度分类器训练。研究者还借鉴其提出的模型锚定偏移(model-anchored shift)度量方法,进一步对比了不同架构的分类器(如XLM-R、ModernBERT)对翻译复杂度保真度的预测差异,为构建更公平、更稳健的跨语言评估框架奠定了理论与实践基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务