pear-data
收藏资源简介:
PEAR MT评估数据集是一个大规模多语言数据集,专门用于机器翻译质量评估,旨在训练和评估PEAR(机器翻译中自动相对评分的成对评估)模型。该数据集整合了来自WMT(机器翻译研讨会)直接评估(DA)、多维质量指标(MQM)以及IndicMT-Eval评估活动的人类翻译质量判断数据,并统一为一致的成对比较格式。每个数据样本包含一个源语言片段、一个可选的人工参考译文、两个由不同机器翻译系统生成的候选译文、对应的系统标识符、人类评估员为每个候选译文分配的质量评分(包括原始评分和Z标准化评分),以及丰富的上下文元数据,如评估年份、语言对、文本领域、文档和片段标识信息等。数据集提供两种配置:da配置包含从WMT16至WMT23直接评估数据衍生的14,474,448个训练样本;mqm配置包含从WMT20至WMT23 MQM及IndicMT-Eval数据衍生的13,110,486个训练样本,以及一个包含207,111个样本的测试集(来自WMT24 MQM的en-de、en-es和ja-zh语言对)。该数据集适用于机器翻译质量估计、成对排名、自动评估指标开发和基准测试等任务,支持多语言场景。
The PEAR MT evaluation dataset is a large-scale multilingual dataset designed for machine translation quality assessment, specifically built for training and evaluating the PEAR (Pairwise Evaluation for Automated Relative ranking in machine translation) model. It integrates human translation quality judgments from WMT (Workshop on Machine Translation) Direct Assessment (DA), Multidimensional Quality Metrics (MQM), and the IndicMT-Eval evaluation campaign, unified into a consistent pairwise comparison format. Each data sample includes a source language segment, an optional human reference translation, two candidate translations generated by different machine translation systems, corresponding system identifiers, quality scores assigned by human evaluators for each candidate (including raw scores and Z-normalized scores), and rich contextual metadata such as evaluation year, language pair, text domain, document, and segment identification information. The dataset offers two configurations: the da configuration contains 14,474,448 training samples derived from WMT16 to WMT23 direct assessment data; the mqm configuration contains 13,110,486 training samples derived from WMT20 to WMT23 MQM and IndicMT-Eval data, along with a test set of 207,111 samples (from WMT24 MQM for en-de, en-es, and ja-zh language pairs). This dataset is suitable for tasks such as machine translation quality estimation, pairwise ranking, automatic evaluation metric development, and benchmarking, supporting multilingual scenarios.
数据集概述
PEAR MT Evaluation Data 是一个用于机器翻译成对评估的数据集,旨在训练和评估 PEAR(Pairwise Evaluation for Automatic Relative Scoring in Machine Translation)模型。
数据集组成
数据集包含两个配置(configurations):
| 配置名称 | 数据拆分 | 内容说明 |
|---|---|---|
da |
train |
源自 WMT16–WMT23 Direct Assessment (DA) 数据的成对评估示例 |
mqm |
train, test |
训练集源自 WMT20–WMT23 MQM 和 IndicMT-Eval 数据;测试集为 WMT24 MQM 数据(语言对:en-de, en-es, ja-zh) |
数据规模
da配置:训练集包含 14,474,448 个样本,数据集大小约 10.47 GB。mqm配置:训练集包含 13,110,486 个样本(约 9.68 GB),测试集包含 207,111 个样本(约 228 MB)。
数据特征
所有配置共享相同的字段模式:
| 字段名 | 类型 | 描述 |
|---|---|---|
year |
字符串 | 评估活动或数据集名称(如 wmt23 或 IndicMT-Eval) |
lp |
字符串 | 源语言-目标语言对 |
domain |
字符串 | 文本领域或测试集 |
global_seg_id |
整数(可空) | 当年源语言数据中的片段标识符 |
doc_id |
字符串(可空) | 文档标识符 |
doc_seg_id |
整数(可空) | 文档内的片段位置 |
protocol |
字符串(可空) | 明确可用时的人类评估协议 |
src |
字符串 | 源语言片段 |
ref |
字符串(可空) | 人工参考翻译 |
sys_0 |
字符串 | 第一个候选系统标识符 |
mt_0 |
字符串 | 第一个候选翻译 |
raw_score_0 |
浮点数(可空) | 第一个候选的原始人类评分 |
z-score_0 |
浮点数(可空) | 第一个候选的 Z 标准化 DA 分数 |
sys_1 |
字符串 | 第二个候选系统标识符 |
mt_1 |
字符串 | 第二个候选翻译 |
raw_score_1 |
浮点数(可空) | 第二个候选的原始人类评分 |
z-score_1 |
浮点数(可空) | 第二个候选的 Z 标准化 DA 分数 |
缺失值以 null 表示。
来源与许可
- 数据整合自 WMT DA、WMT MQM 和 IndicMT-Eval 的人工评判。
- 许可证为
other,非单一许可证:- IndicMT-Eval 衍生数据采用 CC0 1.0 Universal。
- WMT 衍生数据受相应 WMT 发布条款约束。
- 具体许可信息详见仓库的 LICENSE 文件。
引用
使用本数据集时,请引用 PEAR 论文;若使用源自 IndicMT-Eval 的示例,请同时引用 IndicMT-Eval 论文。用户还需根据实际使用的年份和子集,引用相应的 WMT 共享任务概述和指标论文。
相关链接
- 代码:https://github.com/prosho-97/pear
- 论文:https://aclanthology.org/2026.acl-long.1953/
- PEAR 模型:https://huggingface.co/Prosho/pear
- PEAR-XL 模型:https://huggingface.co/Prosho/pear-xl
- 数据集集合:https://huggingface.co/collections/Prosho/pear




