遇见数据集

softcatala/Europarl-catalan

收藏
Hugging Face2026-07-16 更新2024-03-04 收录
官方服务:

资源简介:

该数据集包含两个数据集对,对应Europarl语料库。英语和德语版本与加泰罗尼亚语翻译对齐,加泰罗尼亚语翻译是通过Apertium的基于规则的机器翻译系统从西班牙语-英语对齐的西班牙语版本获得的。加泰罗尼亚语-德语对齐是通过使用对齐查找器从德语-英语和加泰罗尼亚语-英语数据中通过枢轴语言对齐过程获得的。具体数据量:加泰罗尼亚语-英语有1,965,735个片段,加泰罗尼亚语-德语有1,734,644个片段。该数据集可用于训练神经机器翻译和统计机器翻译系统,并已用于Softcatalà机器翻译引擎的训练语料库。数据集支持加泰罗尼亚语、德语和英语,主要基于欧洲议会会议记录,覆盖正式、制度、政治和立法语言,但可能不适用于日常加泰罗尼亚语的广泛样本。加泰罗尼亚语侧是机器生成的,可能包含翻译错误或不自然的表达,对齐也可能存在噪音。

This dataset contains two dataset pairs corresponding to the Europarl corpus. Both the English and the German version are aligned with the Catalan translation, which has been obtained using Apertiums RBMT system from the Spanish version of the Spanish-English alignment. Catalan-German alignment has been obtained using an alignment finder from de-en and ca-en through a pivot-language alignment process. Specific data volumes: Catalan-English has 1,965,735 segments, and Catalan-German has 1,734,644 segments. The dataset can be used to train NMT and SMT systems and has been used as a training corpus for the Softcatalà machine translation engine. It supports Catalan, German, and English, primarily based on European Parliament proceedings, covering formal, institutional, political, and legislative language, but may not be suitable as a broad sample of everyday Catalan. The Catalan side is machine-generated and may contain translation errors or unnatural phrasing, and alignment may also contain noise.

提供机构:
softcatala
原始信息汇总

数据集概述

数据集名称

  • 名称: Tilde-MODEL-Catalan
  • 别名: Catalan-English and Catalan-German aligned corpora to train NMT systems.

数据集描述

  • 摘要: 该数据集包含两个数据集对,对应于Europarl语料库。英语和德语版本均与加泰罗尼亚语翻译对齐,其中加泰罗尼亚语-德语对齐是通过使用对齐查找器从de-en和ca-en获得的。
  • 支持的任务: 用于训练NMT和SMT系统。
  • 语言: 加泰罗尼亚语 (ca), 德语 (de), 英语 (en)。

数据集结构

  • 数据实例: 待补充。
  • 数据字段: 原始文本。
  • 数据分割: 每种语言一个文件。

数据集创建

  • 源数据: 扩展自Europarl双语数据集。
  • 许可证: CC BY 4.0

数据集大小

  • 大小类别: 1M<n<10M。

多语言性

  • 多语言性: 翻译。

数据集创建者

  • 注释创建者: 无注释。
  • 语言创建者: 机器生成。

数据集使用考虑

  • 社会影响: 待补充。
  • 偏见讨论: 待补充。
  • 其他已知限制: 待补充。

附加信息

搜集汇总
数据集介绍
softcatala/Europarl-catalan 数据集图片
构建方式
Europarl-catalan数据集基于Europarl v7语料库构建,重点拓展了加泰罗尼亚语与英语、德语的平行语料。原始西班牙语版本经过拼写纠错与标准化后,借助Apertium基于规则的机器翻译系统转化为加泰罗尼亚语。加泰罗尼亚语-德语的对齐则通过枢轴语言策略实现,利用已有的德语-英语与加泰罗尼亚语-英语平行语料,经由对齐查找工具完成句子级匹配,最终形成两个高质量的双语对齐语料对。
特点
该数据集包含两个核心语言对:加泰罗尼亚语-英语(约196万句段)与加泰罗尼亚语-德语(约173万句段),规模庞大且来源权威。语料源自欧洲议会会议记录,语言风格正式、专业,覆盖政治、立法等 institutional 领域。加泰罗尼亚语部分虽为机器生成,但经过源语言优化,确保了翻译的规范性与一致性。同时,数据集采用CC BY 4.0许可,便于学术界与工业界自由使用。
使用方法
数据集以压缩文件形式提供,每个语言对的源语言与目标语言分别存储为独立的文本文件,如europarl.en-ca.ca.xz与europarl.en-ca.en.xz,行号一一对应,便于并行读取。用户可将其直接用于训练神经机器翻译(NMT)或统计机器翻译(SMT)模型。数据无需额外标注,仅需进行简单的解压缩与行对齐操作,适合快速集成至标准翻译流水线中。
背景与挑战
背景概述
Europarl-catalan数据集由Softcatala团队于近年创建,核心研究人员包括Jordi Mas与David Canovas。该数据集聚焦于加泰罗尼亚语与英语、德语之间的机器翻译领域,旨在缓解低资源语言在神经机器翻译(NMT)系统训练中平行语料匮乏的困境。基于Europarl v7语料库,研究团队利用Apertium规则机器翻译系统从西班牙语版本生成加泰罗尼亚语翻译,并通过枢轴语言对齐技术构建加泰罗尼亚-德语平行语料。数据集包含近200万条句对,显著提升了加泰罗尼亚语在机器翻译领域的可用性,为Softcatalà翻译引擎提供了核心训练资源,推动了加泰罗尼亚语的自然语言处理研究。
当前挑战
该数据集所解决的领域挑战在于加泰罗尼亚语作为低资源语言,缺乏大规模、高质量的双语平行语料,阻碍了NMT系统的性能提升。构建过程中面临多重困难:加泰罗尼亚语来自机器翻译,需修正西班牙语原文的拼写错误并保证译文准确性;加泰罗尼亚-德语对齐需通过英语作为枢轴语言,引入额外噪声与对齐误差;语料来源为欧盟议会记录,语言风格正式且领域狭窄,难以覆盖日常用语,可能导致翻译模型在通用场景下泛化能力不足。此外,无人工标注干预使得数据质量完全依赖预处理流程,增加了系统性偏差风险。
常用场景
经典使用场景
Europarl-catalan数据集的核心价值在于为加泰罗尼亚语与英语、德语之间的机器翻译研究提供大规模、高质量的平行语料。该数据集源自欧洲议会会议记录,包含近两百万条加泰罗尼亚语-英语平行句对和一百七十余万条加泰罗尼亚语-德语平行句对,其规模足以支撑统计机器翻译(SMT)和神经机器翻译(NMT)系统的训练。作为低资源语言加泰罗尼亚语在翻译领域的宝贵数据资源,该语料库特别适用于开发面向正式、立法和政治语言领域的翻译模型,为加泰罗尼亚语的数字化保护和跨语言信息交流奠定了坚实基础。
衍生相关工作
基于Europarl-catalan数据集,衍生了一系列影响深远的研究工作与工具。该数据集被用于训练Softcatalà首个公开可用的加泰罗尼亚语神经机器翻译引擎,其模型性能作为该语言对主流翻译系统的基准参照。在学术研究中,它启发了基于枢轴语言的语料库构建方法,特别是通过德-英和加泰罗尼亚-英双语的联合对齐生成加泰罗尼亚-德平行语料的技术路线。此外,该数据推动了对机器翻译中领域适配问题的探讨,催生了针对议会语料专门优化的术语抽取和短语表构建算法。它还是评估翻译系统泛化能力的重要资源,被多篇关于低资源语言翻译的低成本数据扩充策略论文引用。
数据集最近研究
最新研究方向
Europarl-catalan数据集聚焦于加泰罗尼亚语与英语、德语间的机器翻译平行语料构建,通过Apertium规则系统从西班牙语版本译入加泰罗尼亚语,并借助枢纽语言对齐技术实现加泰罗尼亚语-德语配对。该数据集积极响应低资源语言神经机器翻译(NMT)的发展浪潮,为加泰罗尼亚语在机构化正式语域(如议会文献)中的翻译系统训练提供了关键资源,尤其支撑了Softcatalà翻译引擎的研发,推动了加泰罗尼亚语在数字语言技术中的可及性与应用前沿。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务