遇见数据集

projecte-aina/CA-DE_Parallel_Corpus

收藏
Hugging Face2025-07-02 更新2024-03-04 收录
官方服务:

资源简介:

--- language: - ca - de multilinguality: - multilingual pretty_name: CA-DE Parallel Corpus size_categories: - 1M<n<10M task_categories: - translation task_ids: [] license: cc-by-sa-4.0 --- # Dataset Card for CA-DE Parallel Corpus ## Dataset Description - **Point of Contact:** langtech@bsc.es ### Dataset Summary The CA-DE Parallel Corpus is a Catalan-German dataset of parallel sentences created to support Catalan in NLP tasks, specifically Machine Translation. ### Supported Tasks and Leaderboards The dataset can be used to train Bilingual Machine Translation models between German and Catalan in any direction, as well as Multilingual Machine Translation models. ### Languages The sentences included in the dataset are in Catalan (CA) and German (DE). ## Dataset Structure ### Data Instances Two separate txt files are provided with the sentences sorted in the same order: - ca-de_6M.ca - ca-de_6M.de The dataset is additionally provided in parquet format: ca-de_6M.parquet. The parquet file contains two columns of parallel text obtained from the two original text files. Each row in the file represents a pair of parallel sentences in the two languages of the dataset. ### Data Fields [N/A] ### Data Splits The dataset contains a single split: `train`. ## Dataset Creation ### Curation Rationale This dataset is aimed at promoting the development of Machine Translation between Catalan and other languages, specifically German. ### Source Data #### Initial Data Collection and Normalization The corpus is a combination of the following original datasets collected from [Opus](https://opus.nlpl.eu/): MultiCCAligned, WikiMatrix, GNOME, KDE4, OpenSubtitles, GlobalVoices, Tatoeba, and synthetic parallel data generated from the original Spanish-Catalan Europarl and Tilde corpora made public by [SoftCatalà](https://github.com/Softcatala/Europarl-catalan). All data was filtered according to two specific criteria: - Alignment: sentence level alignments were calculated using [LaBSE](https://huggingface.co/sentence-transformers/LaBSE) and sentence pairs with a score below 0.75 were discarded. - Language identification: the probability of being the target language was calculated using [Lingua.py](https://github.com/pemistahl/lingua-py) and sentences with a language probability score below 0.5 were discarded. The filtered datasets are then concatenated and deduplicated to form the final corpus. #### Who are the source language producers? [Opus](https://opus.nlpl.eu/) [SoftCatalà](https://github.com/Softcatala/Europarl-catalan) ### Annotations #### Annotation process The dataset does not contain any annotations. #### Who are the annotators? [N/A] ### Personal and Sensitive Information Given that this dataset is partly derived from pre-existing datasets that may contain crawled data, and that no specific anonymisation process has been applied, personal and sensitive information may be present in the data. This needs to be considered when using the data for training models. ## Considerations for Using the Data ### Social Impact of Dataset By providing this resource, we intend to promote the use of Catalan across NLP tasks, thereby improving the accessibility and visibility of the Catalan language. ### Discussion of Biases No specific bias mitigation strategies were applied to this dataset. Inherent biases may exist within the data. ### Other Known Limitations The dataset contains data of a general domain. Application of this dataset in more specific domains such as biomedical, legal etc. would be of limited use. ## Additional Information ### Dataset Curators Language Technologies Unit at the Barcelona Supercomputing Center (langtech@bsc.es). This work has been promoted and financed by the Generalitat de Catalunya through the [Aina project](https://projecteaina.cat/). ### Licensing Information This work is licensed under an [Attribution-Share Alike 4.0 International](https://creativecommons.org/licenses/by-sa/4.0/). ### Citation Information [N/A] ### Contributions [N/A]

CA-DE平行语料库是一个包含9,530,709对加泰罗尼亚语(CA)和德语(DE)平行句子的数据集,旨在支持加泰罗尼亚语在自然语言处理任务中的应用,特别是机器翻译。数据集由多个来源的数据集组合而成,包括Multi CCAligned、WikiMatrix、GNOME、KDE4、OpenSubtitles、GlobalVoices、Tatoeba、Books、Europarl和Tilde。部分数据是通过从西班牙语-德语语料库中随机采样并使用PlanTL es-ca模型翻译成加泰罗尼亚语生成的。数据集经过去重和过滤,确保句子对的余弦相似度不低于0.75。数据集仅包含训练集,未包含任何注释。数据集的创建旨在促进加泰罗尼亚语在NLP任务中的使用,提高其可访问性和可见性。

提供机构:
projecte-aina
原始信息汇总

CA-DE Parallel Corpus 数据集概述

数据集描述

数据集概要

CA-DE Parallel Corpus 是一个包含 9,530,709 句平行语料的加泰罗尼亚语-德语数据集。该数据集旨在支持加泰罗尼亚语在自然语言处理任务中的应用,特别是机器翻译。

支持的任务和排行榜

该数据集可用于训练德语和加泰罗尼亚语之间的双语机器翻译模型,以及多语种机器翻译模型。

语言

数据集中的句子包含加泰罗尼亚语(CA)和德语(DE)。

数据集结构

数据实例

提供了两个单独的 txt 文件,句子按相同顺序排列:

  • ca-de_all_2023_09_11.ca:包含 9,530,709 句加泰罗尼亚语句子。
  • ca-de_all_2023_09_11.de:包含 9,530,709 句德语句子。

数据字段

[N/A]

数据分割

数据集包含一个分割:train

数据集创建

策划理由

该数据集旨在促进加泰罗尼亚语与其他语言(特别是德语)之间的机器翻译开发。

源数据

初始数据收集和规范化

数据集是以下原始数据集的组合:

数据集 句子数量
Multi CCAligned 1,027,481
WikiMatrix 125,811
GNOME 1,241
KDE4 105,098
OpenSubtitles 171,376
GlobalVoices 3,578
Tatoeba 655
Books 2,049
Europarl 1,734,643
Tilde 3,434,091

除了 Europarl 和 Tilde 之外的所有语料库均从 Opus 收集。Europarl 和 Tilde 语料库是通过 SoftCatalà 从原始的西班牙语-加泰罗尼亚语语料库创建的合成平行语料库。

剩余的 3,272,437 句是通过对 Opus 上可用的西班牙语-德语语料库进行随机抽样,并使用 PlanTL es-ca 模型翻译成加泰罗尼亚语创建的合成平行数据。

所有数据集都经过去重和过滤,以删除任何余弦相似度小于 0.75 的句子对。这是通过使用 LaBSE 计算的句子嵌入来完成的。过滤后的数据集随后连接形成最终的 9,530,709 句平行语料库。

源语言生产者

Opus

SoftCatalà

注释

注释过程

数据集不包含任何注释。

注释者

[N/A]

个人和敏感信息

由于该数据集部分源自可能包含爬取数据的现有数据集,并且未应用特定的匿名化处理,因此数据中可能存在个人和敏感信息。在使用数据训练模型时需要考虑这一点。

使用数据集的考虑因素

数据集的社会影响

通过提供这一资源,我们旨在促进加泰罗尼亚语在自然语言处理任务中的应用,从而提高加泰罗尼亚语的可访问性和可见性。

偏见的讨论

未对该数据集应用特定的偏见缓解策略。数据中可能存在固有偏见。

其他已知限制

该数据集包含一般领域的数据。在更具体的领域(如生物医学、法律等)中应用该数据集的效用有限。

附加信息

数据集策展人

巴塞罗那超级计算中心语言技术单元(langtech@bsc.es)。

该工作得到了加泰罗尼亚政府通过 Aina 项目 的推广和资助。

许可信息

该工作根据 Attribution-NonCommercial-ShareAlike 4.0 International 许可进行许可。

引用信息

[N/A]

贡献

[N/A]

搜集汇总
数据集介绍
构建方式
该数据集为加泰罗尼亚语与德语之间的平行句对语料库,旨在推动加泰罗尼亚语在机器翻译领域的发展。构建过程中,研究团队从Opus平台整合了MultiCCAligned、WikiMatrix、GNOME、KDE4、OpenSubtitles、GlobalVoices、Tatoeba等多个原始数据集,并引入了由SoftCatalà公开的基于西班牙语-加泰罗尼亚语Europarl和Tilde语料库生成的合成平行数据。所有数据经过严格筛选:首先利用LaBSE模型计算句子级对齐分数,剔除得分低于0.75的句对;随后通过Lingua.py进行语言识别,移除目标语言概率低于0.5的句子。最终将过滤后的数据集合并并去重,形成包含超过六百万句对的最终语料库。
特点
该数据集以平行句对形式呈现,每条数据包含加泰罗尼亚语和德语两个语言版本,句子按相同顺序排列。数据格式灵活,提供独立的文本文件(.ca和.de)以及整合的Parquet格式文件,便于不同使用场景。数据集仅包含单一训练集划分,适用于双语或多语机器翻译模型的训练。其特点在于覆盖广泛领域,包括通用文本、开源软件本地化、字幕和全球新闻等,但未针对特定专业领域(如生物医学或法律)进行优化。此外,数据集未进行匿名化处理,可能包含个人或敏感信息,需在使用时加以注意。
使用方法
使用该数据集时,可加载Parquet文件获取两列平行文本,每行代表一对加泰罗尼亚语与德语对应的句子。对于文本文件,需分别读取.ca和.de文件并按行对应配对。数据集可直接用于训练加泰罗尼亚语与德语之间的双向机器翻译模型,也可作为多语翻译系统的组成部分。建议在使用前进行数据探索,识别并处理可能存在的噪声或偏差。由于数据集来源于多个爬取语料库且未进行偏见缓解,训练后的模型可能继承原始数据中的固有偏见,需在应用场景中审慎评估。
背景与挑战
背景概述
在自然语言处理领域,低资源语言的机器翻译研究长期面临数据匮乏的困境,尤其是加泰罗尼亚语与德语这类非广泛使用的语言对,其平行语料库的构建成为推动多语言技术发展的关键瓶颈。由巴塞罗那超级计算中心语言技术团队于Aina项目框架下创建的CA-DE Parallel Corpus,旨在填补这一空白,为加泰罗尼亚语的机器翻译模型提供高质量的双语训练资源。该数据集整合了来自Opus平台的MultiCCAligned、WikiMatrix、GNOME等多个公开语料库,并融合了SoftCatalà生成的合成数据,通过严格的句子级对齐(LaBSE评分阈值0.75)与语言识别(Lingua.py概率阈值0.5)双重过滤,最终形成包含约600万平行句对的优质资源。该数据集的发布显著提升了加泰罗尼亚语在自然语言处理中的可见度,为构建加泰罗尼亚语-德语双向翻译模型奠定了坚实基础,对促进低资源语言的数字化生存具有里程碑意义。
当前挑战
该数据集所面临的挑战首先体现在领域覆盖的局限性上:其语料主要来自通用领域,在生物医学、法律等专业场景中的翻译表现可能不尽如人意,限制了模型在垂直行业的应用广度。其次,构建过程中的数据筛选虽保证了质量,但依赖LaBSE和Lingua.py的自动过滤可能引入偏差,例如低对齐分数但语义相关的句子被误删,或语言识别模型对短文本的判断失误。此外,数据来源的多样性带来隐私风险,部分源自网络爬取的句子可能包含未匿名化的个人信息,在模型训练中可能引发合规性问题。最后,去重后的语料库虽规模可观,但缺乏对句对语义多样性的显式评估,可能导致模型在捕捉加泰罗尼亚语与德语间的复杂语言结构时存在泛化瓶颈。
常用场景
经典使用场景
该数据集为加泰罗尼亚语与德语之间的平行句对资源,专为机器翻译任务设计。其核心应用场景在于训练双语翻译模型,支持加泰罗尼亚语至德语及德语至加泰罗尼亚语的双向翻译。此外,由于数据规模达到数百万级别,该语料库亦适用于多语言机器翻译系统的构建,可作为多语种翻译模型中的关键语言对组成部分,从而提升低资源语言在神经机器翻译中的表现。
衍生相关工作
该数据集的构建流程与数据来源衍生出多项相关工作。其整合的Opus子语料库如MultiCCAligned、WikiMatrix及OpenSubtitles等,在跨语言对齐与平行语料挖掘领域已有广泛应用。此外,基于该数据集训练的翻译模型可进一步用于跨语言句子嵌入、双语词典构建及零样本翻译等研究方向,推动低资源语言NLP技术的整体进步。
数据集最近研究
最新研究方向
该数据集聚焦于加泰罗尼亚语与德语之间的平行语料构建,旨在推动低资源语言在机器翻译领域的前沿研究。随着多语言自然语言处理技术的快速发展,加泰罗尼亚语作为区域语言的数字化需求日益凸显,尤其是欧洲多语言生态中语言平等与包容性的呼声高涨。该数据集通过融合多源公开语料(如MultiCCAligned、WikiMatrix等),并引入LaBSE进行句子级对齐过滤及Lingua.py语言识别清洗,显著提升了平行句对的质量与规模。其研究意义在于填补加泰罗尼亚语-德语机器翻译的资源空白,支持双语及多语言翻译模型的训练,同时呼应了欧盟对濒危与区域语言技术发展的战略支持。该工作由巴塞罗那超级计算中心主导,并受加泰罗尼亚政府Aina项目资助,体现了公共机构在语言技术伦理与多样性保护中的关键角色。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务