XQ-MEval
收藏资源简介:
XQ-MEval是一个用于评估跨语言评分偏差的自动评估指标的质量平行基准数据集。该数据集基于Flores+高质量翻译数据集,通过注入多维质量度量(MQM)定义的不同数量的错误构建,支持跨语言的可控和可比较的翻译质量评估。数据集包含英语与中文、老挝语、日语、西班牙语、法语、印尼语、越南语、德语和僧伽罗语的双语对,错误类型包括添加、遗漏、误译和未翻译。数据集分为两个主要部分:results文件夹包含单错误注入的输出,merged_result文件夹包含多错误合并的输出。每个数据实例包含源句子、参考翻译、带有标记错误的机器翻译以及相关元数据。该数据集适用于文本生成、翻译和评估任务,支持对自动翻译评估指标的跨语言偏差进行系统研究。
XQ-MEval is a quality parallel benchmark dataset for evaluating the cross-lingual scoring bias of automatic evaluation metrics. The dataset is constructed based on the Flores+ high-quality translation dataset by injecting different amounts of errors defined by Multidimensional Quality Metrics (MQM), supporting controllable and comparable cross-lingual translation quality evaluation. The dataset includes bilingual pairs of English with Chinese, Lao, Japanese, Spanish, French, Indonesian, Vietnamese, German, and Sinhala, with error types including additions, omissions, mistranslations, and untranslated segments. The dataset is divided into two main parts: the results folder contains outputs with single-error injections, and the merged_result folder contains outputs with merged multiple errors. Each data instance includes the source sentence, reference translation, machine translation with marked errors, and related metadata. The dataset is suitable for text generation, translation, and evaluation tasks, supporting systematic research on cross-lingual bias in automatic translation evaluation metrics.
XQ-MEval 数据集概述
基本信息
- 数据集名称:XQ-MEval
- 许可证:CC-BY-SA 4.0
- 任务类别:文本生成、翻译
- 语言:英语、中文、日语、老挝语、西班牙语、僧伽罗语、德语、法语、越南语、印尼语
- 数据规模:1K < n < 10K
- 标签:文本、翻译、评估
数据集描述
XQ-MEval 是一个用于评估自动翻译评价指标跨语言评分偏差的质量平行基准数据集。该数据集通过向高质量翻译中注入不同数量的多维质量度量(MQM)定义的错误构建而成,实现了跨语言的可控且可比较的翻译质量。
数据来源
- 高质量翻译数据集:Flores+
- 语言对(9组):
- 英语-中文(en-zh)
- 英语-老挝语(en-lo)
- 英语-日语(en-ja)
- 英语-西班牙语(en-es)
- 英语-法语(en-fr)
- 英语-印尼语(en-id)
- 英语-越南语(en-vi)
- 英语-德语(en-de)
- 英语-僧伽罗语(en-si)
错误类型
- 添加(Addition)
- 遗漏(Omission)
- 误译(Mistranslation)
- 未翻译(Untranslated)
数据分布
各语言对质量等级三元组数量分布
| 质量等级 | en-zh | en-lo | en-ja | en-vi | en-id | en-fr | en-es | en-si | en-de |
|---|---|---|---|---|---|---|---|---|---|
| 1 | 776 | 753 | 775 | 771 | 782 | 775 | 771 | 765 | 774 |
| 2 | 2,109 | 2,053 | 2,078 | 2,056 | 2,095 | 1,992 | 2,016 | 2,064 | 2,049 |
| 3 | 2,548 | 2,627 | 2,441 | 2,420 | 2,421 | 2,068 | 2,233 | 2,489 | 2,337 |
| 4 | 1,466 | 1,704 | 1,324 | 1,387 | 1,311 | 957 | 1,069 | 1,432 | 1,234 |
| 5 | 406 | 558 | 340 | 428 | 312 | 198 | 203 | 361 | 313 |
数据集组织结构
数据集包含两个文件夹:
- results:包含单一注入错误(4种类型)的GPT-4o输出。文件名格式为:
<源语言>-<目标语言>-<错误类型>.parquet - merged_result:包含通过合并单一错误输出形成的多错误输出。文件名格式为:
<源语言>-<目标语言>-merge-<质量等级>.parquet
数据字段说明
| 字段 | 描述 |
|---|---|
| language | 翻译的目标语言 |
| count_id | 条目的顺序索引 |
| segment_id | Flores+中句子的索引 |
| error_type | 注入错误的类型 |
| error_position | 注入错误的位置(head 或 end) |
| reject | 人工筛选时是否被拒绝 |
| number | merged_mt中注入的错误数量 |
| spans | 注入错误的索引位置 |
| src | 来自Flores+的英语源句子 |
| ref | 来自Flores+的目标语言参考译文 |
| mt | 包含单个注入错误的翻译(用<v></v>标记) |
| merged_mt | 包含多个错误片段的合并翻译(用<v></v>标记) |
数据加载示例
python from datasets import load_dataset
ds_results = load_dataset("naist-nlp/XQ-MEval", "results") ds_merged = load_dataset("naist-nlp/XQ-MEval", "merged_result")
引用信息
如果您在研究中使用XQ-MEval,请引用以下论文:
- arXiv: 2604.14934




