遇见数据集

natgillin/translations

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个多语言平行语料库,名为Translations,专门用于机器翻译任务。它由上游mtdata和OPUS发布的数据集组装而成,包含多种语言对,如英语与阿塞拜疆语、白俄罗斯语、保加利亚语、加泰罗尼亚语、丹麦语、爱沙尼亚语、芬兰语、古吉拉特语、匈牙利语、卡纳达语、马拉雅拉姆语、挪威语、奥里亚语、旁遮普语、罗马尼亚语、斯洛伐克语、泰米尔语和乌尔都语等。数据集规模在100M到1B之间,以Parquet格式存储,每个语言对有一个独立的配置。数据包括源语言句子、目标语言句子、源语言代码(ISO 639-3标准)、目标语言代码和来源子语料库标识(如opus-ccmatrix、mtdata-merged等)。数据集的许可证遵循上游语料库的条款,需引用OPUS来源。

This dataset is a multilingual parallel corpus named Translations, designed for machine translation tasks. It is assembled from upstream mtdata and OPUS releases, covering multiple language pairs such as English with Azerbaijani, Belarusian, Bulgarian, Catalan, Danish, Estonian, Finnish, Gujarati, Hungarian, Kannada, Malayalam, Norwegian, Odia, Punjabi, Romanian, Slovak, Tamil, and Urdu. The dataset size ranges from 100M to 1B, stored in Parquet format with separate configurations for each language pair. It includes columns for source sentences, target sentences, source language codes (ISO 639-3), target language codes, and origin sub-corpus identifiers (e.g., opus-ccmatrix, mtdata-merged). The license inherits per-corpus terms from the upstream OPUS sources, requiring citation of OPUS.

提供机构:
natgillin
原始信息汇总

数据集:natgillin/translations

  • 任务:翻译
  • 语言:英语、阿塞拜疆语、白俄罗斯语等(共约18种)
  • 大小:1亿到10亿条(100M < n < 1B)
  • 格式:Parquet
  • 许可证:遵循上游语料库的许可条款

数据集描述

该数据集是一个由上游 mtdata / OPUS 发布版本组成的 Parquet 双语平行语料库。

数据模式

每一条数据包含以下字段:

列名 类型 描述
source string 源语言句子
target string 目标语言句子
source_lang string 源语言,ISO 639-3 三字母代码(如 belcateng
target_lang string 目标语言,ISO 639-3 三字母代码
origin string 上游子语料库标识(如 opus-ccmatrixopus-nllbopus-gnomeelrmtdata-merged

源语言/目标语言的顺序按 ISO 639-3 代码的字母顺序固定(例如 beleng 之前),以保证对名确定性,便于双向连接。

文件结构(按语言对划分)

一个语言对一个配置(config)。OPUS 子语料库通过行级列(origin)区分,不作为独立配置。

data/ cat-eng/ opus-ccmatrix-00000-of-00200.parquet opus-nllb-00000-of-00200.parquet opus-gnome-<file_hash>-00000.parquet mtdata-merged-00000-of-00200.parquet ... bel-eng/ ...

每个语言对固定使用 split: train,以避免文件名中如 -test- 的子串被自动识别为测试集。

来源说明(origin 字段常见值)

  • mtdata-merged — mtdata 对该语言对去重合并后的双语文本
  • opus-<source> — 某个上游 OPUS 子语料库,例如:opus-ccmatrixopus-nllbopus-ccalignedopus-multiccalignedopus-wikimatrixopus-eubookshopopus-kde4opus-gnomeopus-neulab-tedtalksopus-elrc-*opus-tatoebaopus-ted2020
  • elr — 来自 ELRA / ELR 的语料切片
  • unknown — 无法匹配任何已知 OPUS 模式的记录

引用说明

许可条款遵循上游 OPUS 来源的每个语料库许可证。引用时请参考 OPUS:https://opus.nlpl.eu

搜集汇总
数据集介绍
natgillin/translations 数据集图片
构建方式
Translations数据集汇集了来自mtdata与OPUS发布的多语种平行语料,以Parquet格式存储。其构建遵循确定性原则:源语言与目标语言的排序固定为ISO 639-3三字母代码的字母顺序,确保语对名称的唯一性与双向连接的无歧义性。每个语对对应一个独立的数据配置(config),底层OPUS子语料库通过行级列“origin”编码,而非独立配置,从而简化了数据组织结构。所有语对均被固定为训练集(split: train),避免文件名中的“-test-”等子串被误判为测试集。
特点
该数据集规模介于1亿至10亿条之间,覆盖包括英语与阿塞拜疆语、白俄罗斯语、保加利亚语等在内的19种语言,形成17个双语平行语对。其核心特点在于引入了“origin”列,详细标注每条数据的上游来源,如mtdata-merged、opus-ccmatrix、opus-nllb等,兼顾了可追溯性与语料多样性。来源标识使研究者能够根据具体子语料库进行过滤或评估,提升了数据使用的灵活性与透明度。
使用方法
使用时可通过HuggingFace Datasets库加载指定语对的配置,例如加载英语-加泰罗尼亚语对,只需调用load_dataset('natgillin/translations', 'cat-eng')。数据以Parquet格式存储,支持高效的列式读取与过滤。通过访问“origin”字段,用户可筛选特定子语料库的样本,如仅保留来自opus-ccmatrix的条目。所有数据仅提供训练集,无需区分训练、验证或测试划分,简化了流水线设计。
背景与挑战
背景概述
在神经机器翻译领域,大规模、高质量的双语平行语料库是驱动模型性能提升的核心基石。Translations数据集由研究者Nat Gillin于近年构建,旨在整合来自MTData与OPUS等多个上游开源项目的平行语料资源,形成一个覆盖广泛语言对且格式统一的集成语料集合。该数据集涵盖了诸如阿塞拜疆语、白俄罗斯语、加泰罗尼亚语、古吉拉特语等19种语言与英语之间的翻译对,语料规模达到十亿级,显著填补了小语种机器翻译训练数据稀缺的空白。通过标准化的模式设计和元数据标注,该数据集为多语言翻译系统的预训练与微调提供了便利的基准资源,也对低资源语言机器翻译的研究产生了积极的推动作用。
当前挑战
Translations数据集所应对的核心领域挑战在于,现有多数平行语料库集中于英法、英中等高资源语言对,而大量低资源语种的翻译质量严重受限于公开数据的匮乏与质量参差。该数据集需整合来自OPUS、MTData等多个来源的子语料,这些语料在格式、对齐质量、领域分布与许可条款上差异巨大,使得统一清洗、去重与标准化的构建过程极具难度。例如,部分子语料来自众包翻译平台,存在噪声与错误对齐;某些语言对的语料量极小,可能导致训练样本不均衡。此外,上游许可协议的差异性要求在数据分发时遵循混合许可模式,增加了合规管理的复杂性。
常用场景
经典使用场景
Translations数据集的核心使用场景在于为机器翻译领域提供大规模、高质量的双语平行语料,尤其适用于低资源语言对(如阿塞拜疆语-英语、孟加拉语-英语等)的神经机器翻译模型训练。该数据集整合了来自MTData和OPUS等多个上游语料库的清洗与去重结果,覆盖超过二十种语言对,每条记录包含源语言句子、目标语言句子、语言代码及语料来源,为多语言翻译系统的开发奠定了坚实的数-据基石。研究者可基于其丰富的语言覆盖度和统一的格式,便捷地构建多语翻译模型,或针对特定领域(如医疗、法律)的翻译任务进行微调与评估。
解决学术问题
该数据集有效解决了机器翻译研究中普遍存在的平行语料匮乏与数据异构问题,特别是为低资源语种提供了规模可观且来源可溯的训练素材。通过整合OPUS、ELRA等不同规范与质量层次的语料并统一成标准化表格结构,Translations使得跨语言对的公平比较、噪声鲁棒性分析以及多源数据融合策略的探索成为可能。其清晰的‘origin’字段标注了每一条数据的上游源头,支持学者追溯语料归属并开展数据质量对翻译性能影响的系统性研究,进而推动了多语言、低资源场景下翻译模型泛化能力的提升。
衍生相关工作
Translations数据集的发布催生了一系列经典研究工作,包括基于其语料构建的多语言预训练语言模型(如XLM-R、mT5)的翻译基准评估,以及面向低资源语言对的对比学习与知识蒸馏方法探索。围绕该数据集,研究者开发了多种数据增强技术,如反向翻译与噪声注入,以进一步提升翻译鲁棒性。此外,针对OPUS语料库的异构性质,相关工作还深入探讨了多源数据混合训练的优化策略,以及利用‘origin’字段进行域适应与领域迁移学习的方法,这些衍生成果共同推动了机器翻译在规模化与精细化两个维度的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务