ALIA_DocMT_Evaluation
收藏资源简介:
该数据集是一个多语言平行语料库,主要用于文档级机器翻译模型的评估和多语言自然语言处理研究。数据集包含7个子集,涵盖巴斯克语(eu)、西班牙语(es)和英语(en)之间的平行文本。数据来源多样,包括杂志文章(aldizkariak)、新闻文本(berria)、巴斯克官方公报(bopv)、平行语料(eusparallel)、指令文本(instructions)、议会记录(parliament)和播客文本(podcast)。数据集总样本量超过1000个,每个子集都包含测试分割。数据特征因子集而异,通常包含文本ID、源语言文本(巴斯克语)以及对应的西班牙语和/或英语翻译。部分子集还包含元数据信息,如发布日期、URL、标题、演讲者、政党等。该数据集在CC-BY-SA 4.0许可下发布,由ALIA/HiTZ团队整理,资金来源于欧盟NextGenerationEU计划。
This dataset is a multilingual parallel corpus primarily used for evaluating document-level machine translation models and multilingual natural language processing research. It contains 7 subsets covering parallel texts between Basque (eu), Spanish (es), and English (en). The data sources are diverse, including magazine articles (aldizkariak), news texts (berria), the Basque Official Gazette (bopv), parallel corpora (eusparallel), instruction texts (instructions), parliamentary records (parliament), and podcast texts (podcast). The total sample size exceeds 1000, with each subset including test splits. Data features vary by subset, typically containing text IDs, source language texts (Basque), and corresponding Spanish and/or English translations. Some subsets also include metadata such as publication date, URL, title, speaker, political party, etc. The dataset is released under the CC-BY-SA 4.0 license, curated by the ALIA/HiTZ team, with funding from the EU NextGenerationEU program.
数据集概述
ALIA_DocMT_Evaluation 是一个用于评估文档级机器翻译模型的多语言数据集,由 HiTZ 团队发布,采用 CC-BY-SA-4.0 许可证。
数据集构成
该数据集包含 7 个子集(config),每个子集仅提供 test 拆分,用于模型评估。
| 子集名称 | 数据量(样本数) | 数据大小 | 语言对 |
|---|---|---|---|
| aldizkariak_eu_es_en | 60 | 175,976 bytes | 巴斯克语 → 西班牙语、英语 |
| berria_eu_es_en | 77 | 251,931 bytes | 巴斯克语 → 西班牙语、英语 |
| bopv_eu_es | 40 | 146,508 bytes | 巴斯克语 ↔ 西班牙语 |
| eusparallel_eu_es_en | 66 | 323,813 bytes | 巴斯克语 → 西班牙语、英语 |
| instructions_eu_es_en | 753 | 612,805 bytes | 巴斯克语 → 西班牙语、英语 |
| parliament_eu_es | 38 | 141,483 bytes | 巴斯克语 ↔ 西班牙语 |
| podcast_eu_es | 17 | 704,242 bytes | 巴斯克语 → 西班牙语 |
数据字段
各子集字段略有不同,主要包含:
- id / uid:样本唯一标识符
- text / text_eu / src:源语言文本(巴斯克语)
- translation_es / text_es:西班牙语翻译
- translation_en / en_translation:英语翻译(部分子集)
- meta:元数据字段,包括标题、日期、来源、发言人、政党等信息(部分子集)
- date / url:日期和原网址(部分子集)
用途与背景
- 用途:文档级机器翻译模型评估及多语言 NLP 研究
- 资助:由西班牙数字化转型与公共职能部通过欧盟 NextGenerationEU 资金资助(ALIA 项目)
- 引用:使用该数据集时请引用 ALIA 项目及对应翻译模型




