Helsinki-NLP/opus_dgt
收藏资源简介:
OPUS DGT数据集是由欧盟联合研究中心的翻译总局(DGT)提供的翻译记忆库集合,包含25种语言和299个双语文本对。数据集的最新版本为v2019。用户可以通过指定语言代码对来加载数据集中的语言对。数据集的结构包括唯一标识符和翻译对,且仅包含一个训练集分割。
The OPUS DGT Dataset is a collection of translation memories provided by the Directorate-General for Translation (DGT) of the European Commission's Joint Research Centre. It covers 25 languages and 299 bilingual text pairs, with its latest version being v2019. Users can load the target language pairs in the dataset by specifying corresponding language code pairs. The dataset structure consists of unique identifiers and translation pairs, and it only contains one training set split.
数据集概述
名称: OPUS DGT
语言: 支持多种语言,包括但不限于bg, cs, da, de, el, en, es, et, fi, fr, ga, hr, hu, it, lt, lv, mt, nl, pl, pt, ro, sh, sk, sl, sv。
许可证: 未知
多语言性: 多语言
大小类别: 包含多个大小类别,如100K<n<1M, 10K<n<100K, 1M<n<10M。
源数据集: 原始数据
任务类别: 翻译
配置名称: 包括多个配置,如bg-ga, bg-hr, bg-sh, es-ga, fi-ga, ga-nl, ga-sh, hr-sk, hr-sv, mt-sh等。
数据集结构
数据实例:
- id (字符串): 平行句对的唯一标识符。
- translation (字典): 包含两种语言的平行句子。
数据字段:
- id: 字符串类型,平行句对的唯一标识。
- translation: 字典类型,包含两种语言的翻译内容。
数据分割:
- 仅包含一个
train分割。
数据集创建
许可证信息:
- 数据集的使用需遵守欧洲委员会的决定,具体条件见官方期刊L330,2011年12月14日,页39至42。
引用信息:
- 使用数据集时,需引用以下文献:
- Steinberger, Ralf 等,"DGT-TM: A freely available Translation Memory in 22 languages"。
- Tiedemann, Jörg,"Parallel Data, Tools and Interfaces in OPUS"。




