遇见数据集

pear-data

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

PEAR MT评估数据集是一个大规模多语言数据集,专门用于机器翻译质量评估,旨在训练和评估PEAR(机器翻译中自动相对评分的成对评估)模型。该数据集整合了来自WMT(机器翻译研讨会)直接评估(DA)、多维质量指标(MQM)以及IndicMT-Eval评估活动的人类翻译质量判断数据,并统一为一致的成对比较格式。每个数据样本包含一个源语言片段、一个可选的人工参考译文、两个由不同机器翻译系统生成的候选译文、对应的系统标识符、人类评估员为每个候选译文分配的质量评分(包括原始评分和Z标准化评分),以及丰富的上下文元数据,如评估年份、语言对、文本领域、文档和片段标识信息等。数据集提供两种配置:da配置包含从WMT16至WMT23直接评估数据衍生的14,474,448个训练样本;mqm配置包含从WMT20至WMT23 MQM及IndicMT-Eval数据衍生的13,110,486个训练样本,以及一个包含207,111个样本的测试集(来自WMT24 MQM的en-de、en-es和ja-zh语言对)。该数据集适用于机器翻译质量估计、成对排名、自动评估指标开发和基准测试等任务,支持多语言场景。

The PEAR MT evaluation dataset is a large-scale multilingual dataset designed for machine translation quality assessment, specifically built for training and evaluating the PEAR (Pairwise Evaluation for Automated Relative ranking in machine translation) model. It integrates human translation quality judgments from WMT (Workshop on Machine Translation) Direct Assessment (DA), Multidimensional Quality Metrics (MQM), and the IndicMT-Eval evaluation campaign, unified into a consistent pairwise comparison format. Each data sample includes a source language segment, an optional human reference translation, two candidate translations generated by different machine translation systems, corresponding system identifiers, quality scores assigned by human evaluators for each candidate (including raw scores and Z-normalized scores), and rich contextual metadata such as evaluation year, language pair, text domain, document, and segment identification information. The dataset offers two configurations: the da configuration contains 14,474,448 training samples derived from WMT16 to WMT23 direct assessment data; the mqm configuration contains 13,110,486 training samples derived from WMT20 to WMT23 MQM and IndicMT-Eval data, along with a test set of 207,111 samples (from WMT24 MQM for en-de, en-es, and ja-zh language pairs). This dataset is suitable for tasks such as machine translation quality estimation, pairwise ranking, automatic evaluation metric development, and benchmarking, supporting multilingual scenarios.

创建时间:
2026-07-22
原始信息汇总

数据集概述

PEAR MT Evaluation Data 是一个用于机器翻译成对评估的数据集,旨在训练和评估 PEAR(Pairwise Evaluation for Automatic Relative Scoring in Machine Translation)模型。

数据集组成

数据集包含两个配置(configurations):

配置名称 数据拆分 内容说明
da train 源自 WMT16–WMT23 Direct Assessment (DA) 数据的成对评估示例
mqm train, test 训练集源自 WMT20–WMT23 MQM 和 IndicMT-Eval 数据;测试集为 WMT24 MQM 数据(语言对:en-de, en-es, ja-zh)

数据规模

  • da 配置:训练集包含 14,474,448 个样本,数据集大小约 10.47 GB。
  • mqm 配置:训练集包含 13,110,486 个样本(约 9.68 GB),测试集包含 207,111 个样本(约 228 MB)。

数据特征

所有配置共享相同的字段模式:

字段名 类型 描述
year 字符串 评估活动或数据集名称(如 wmt23IndicMT-Eval
lp 字符串 源语言-目标语言对
domain 字符串 文本领域或测试集
global_seg_id 整数(可空) 当年源语言数据中的片段标识符
doc_id 字符串(可空) 文档标识符
doc_seg_id 整数(可空) 文档内的片段位置
protocol 字符串(可空) 明确可用时的人类评估协议
src 字符串 源语言片段
ref 字符串(可空) 人工参考翻译
sys_0 字符串 第一个候选系统标识符
mt_0 字符串 第一个候选翻译
raw_score_0 浮点数(可空) 第一个候选的原始人类评分
z-score_0 浮点数(可空) 第一个候选的 Z 标准化 DA 分数
sys_1 字符串 第二个候选系统标识符
mt_1 字符串 第二个候选翻译
raw_score_1 浮点数(可空) 第二个候选的原始人类评分
z-score_1 浮点数(可空) 第二个候选的 Z 标准化 DA 分数

缺失值以 null 表示。

来源与许可

  • 数据整合自 WMT DAWMT MQMIndicMT-Eval 的人工评判。
  • 许可证为 other,非单一许可证:
    • IndicMT-Eval 衍生数据采用 CC0 1.0 Universal
    • WMT 衍生数据受相应 WMT 发布条款约束。
  • 具体许可信息详见仓库的 LICENSE 文件。

引用

使用本数据集时,请引用 PEAR 论文;若使用源自 IndicMT-Eval 的示例,请同时引用 IndicMT-Eval 论文。用户还需根据实际使用的年份和子集,引用相应的 WMT 共享任务概述和指标论文。

相关链接

  • 代码:https://github.com/prosho-97/pear
  • 论文:https://aclanthology.org/2026.acl-long.1953/
  • PEAR 模型:https://huggingface.co/Prosho/pear
  • PEAR-XL 模型:https://huggingface.co/Prosho/pear-xl
  • 数据集集合:https://huggingface.co/collections/Prosho/pear
搜集汇总
数据集介绍
pear-data 数据集图片
构建方式
该数据集是PEAR(成对机器翻译质量自动相对评分系统)的核心训练与评估基准,其构建过程融合了多个权威人工评测资源。数据集的构建始于对WMT Direct Assessment(DA)及Multidimensional Quality Metrics(MQM)历年评测数据(涵盖WMT16至WMT24)的系统性整合,同时纳入IndicMT-Eval针对印度语言的评测数据。原始数据经统一模式化处理,每条记录包含源语言片段、可选的参考译文、两段候选译文及对应系统标识,并附有人工质量评分及领域、语言对等元信息,最终形成涵盖DA和MQM两种配置的结构化数据集。
特点
该数据集的核心特征在于其多维度、跨年度的成对比较架构。DA配置汇集了WMT16至WMT23的直评数据,MQM配置则整合了WMT20至WMT23及IndicMT-Eval的多维质量指标评测,并特别保留了WMT24的测试集。每条数据均包含原始分与Z-score标准化分,字段设计完整覆盖了源文、候选译文、系统来源及评分信息,为机器翻译质量评估提供了丰富的对比维度。数据量级庞大,整体超过千万条,语言覆盖多语种,充分满足了大规模训练与跨领域评估的需求。
使用方法
使用该数据集时,可通过HuggingFace Datasets库便捷加载。用户可分别调用DA和MQM两种配置,选择训练集或测试集,并支持流式读取以避免完整下载。数据集设计紧密契合PEAR评分工具的使用流程,用户可借助pear-mt包直接对成对译文进行评分:通过加载数据集中的源文及两段候选译文,调用score_pairwise函数即可获得偏好结果。此外,数据集支持输出为TSV格式,便于通过PEAR命令行工具进行批量评分与模型验证。
背景与挑战
背景概述
PEAR数据集由Proietti等人于2026年创建,旨在为机器翻译的成对相对评分提供标准化的评估基准。该研究汇集了WMT Direct Assessment(DA)、WMT多维质量指标(MQM)以及IndicMT-Eval等多源人工评价数据,统一了从WMT16至WMT24的跨年度、跨语言对及跨领域的人类判断信息。数据集的发布隶属于ACL 2026会议,其核心研究问题聚焦于如何通过成对比较而非绝对打分来更可靠地度量翻译质量,进而训练出能自动预测相对优劣的PEAR评分模型。这一成果为机器翻译质量评估领域引入了新的方法论视角,显著推动了自动化评分与人工评估之间一致性的提升。
当前挑战
PEAR数据集面临的首要挑战在于解决机器翻译评估中长期存在的领域内问题:传统指标如BLEU与人类判断的相关性有限,而绝对评分方法受标注者主观差异影响较大,成对比较虽能提供更稳健的相对排序,但如何从异质、稀疏且协议各异的人工标注中提取一致信号是一大难题。构建过程中,研究者需要处理WMT和IndicMT-Eval间元数据的缺失与不一致(如不同年份的评分协议、领域标签的差异),并将百亿级规模的多语言样本映射至统一schema,同时确保空值处理的透明性;此外,混合许可证带来的法律合规性要求也增加了数据整合的复杂性。
常用场景
经典使用场景
机器翻译领域中的成对质量评估(Pairwise Evaluation)是pear-data数据集最为经典的使用场景。该数据集以统一的模式整合了WMT Direct Assessment、WMT Multidimensional Quality Metrics与IndicMT-Eval等多项权威评测任务中的成对人工评判数据,为每一对候选译文提供来源语段、参考译文、系统标识及人工评分等丰富元信息。研究者可据此训练或评估能够区分两段译文质量高低的自动评分模型,从而在机器翻译评估的精细化方向上奠定坚实的数据基础。
衍生相关工作
pear-data数据集直接孵化了PEAR与PEAR-XL这两项经典的自动成对评分工作,分别作为轻量级与高容量模型被收录于Hugging Face模型库。围绕该数据集,学术界已涌现出若干致力于跨语种相对评估的后续研究,例如在低资源语言上微调PEAR模型以拓展其适用范围,以及将成对评分框架与语义解析技术相融合来提升区分度。同时,该数据集的统一格式亦催生了将DA与MQM两种协议按需重新组合的训练策略,为更灵活的评估方案开启了可能。
数据集最近研究
最新研究方向
当前,机器翻译质量评估领域正经历从系统级绝对评分向句子级成对相对排序的范式转变,pear-data数据集正是这一前沿方向的集大成之作。该数据集匠心独运地将WMT多年的直接评估与多维质量指标数据,以及IndicMT-Eval对于印度语言的丰富标注,统一纳入了成对比较的通用框架,为训练和评测PEAR这类自动相对评分模型提供了坚实基石。其蕴含的海量多语言成对翻译及其人类评分,不仅能够助力研究者训练出更为精准、与人类偏好高度相关的评估模型,更预示了未来翻译系统评价将更倚重细粒度、可解释的自动比较。这一资源的开源,无疑将极大推动高质量、低成本的机器翻译评估流程,加速多语言翻译技术的迭代与落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务