遇见数据集

Helsinki-NLP/bible_para

收藏
Hugging Face2024-01-18 更新2024-05-25 收录
官方服务:

资源简介:

--- annotations_creators: - found language_creators: - found language: - acu - af - agr - ake - am - amu - ar - bg - bsn - cak - ceb - ch - chq - chr - cjp - cni - cop - crp - cs - da - de - dik - dje - djk - dop - ee - el - en - eo - es - et - eu - fi - fr - gbi - gd - gu - gv - he - hi - hr - hu - hy - id - is - it - ja - jak - jiv - kab - kbh - kek - kn - ko - la - lt - lv - mam - mi - ml - mr - my - ne - nhg - nl - 'no' - ojb - pck - pes - pl - plt - pot - ppk - pt - quc - quw - ro - rom - ru - shi - sk - sl - sn - so - sq - sr - ss - sv - syr - te - th - tl - tmh - tr - uk - usp - vi - wal - wo - xh - zh - zu license: - cc0-1.0 multilinguality: - multilingual size_categories: - 10K<n<100K source_datasets: - original task_categories: - translation task_ids: [] paperswithcode_id: null pretty_name: BiblePara dataset_info: - config_name: de-en features: - name: id dtype: string - name: translation dtype: translation: languages: - de - en splits: - name: train num_bytes: 17262178 num_examples: 62195 download_size: 5440713 dataset_size: 17262178 - config_name: en-fr features: - name: id dtype: string - name: translation dtype: translation: languages: - en - fr splits: - name: train num_bytes: 17536445 num_examples: 62195 download_size: 5470044 dataset_size: 17536445 - config_name: en-es features: - name: id dtype: string - name: translation dtype: translation: languages: - en - es splits: - name: train num_bytes: 17105724 num_examples: 62191 download_size: 5418998 dataset_size: 17105724 - config_name: en-fi features: - name: id dtype: string - name: translation dtype: translation: languages: - en - fi splits: - name: train num_bytes: 17486055 num_examples: 62026 download_size: 5506407 dataset_size: 17486055 - config_name: en-no features: - name: id dtype: string - name: translation dtype: translation: languages: - en - 'no' splits: - name: train num_bytes: 16681323 num_examples: 62107 download_size: 5293164 dataset_size: 16681323 - config_name: en-hi features: - name: id dtype: string - name: translation dtype: translation: languages: - en - hi splits: - name: train num_bytes: 27849361 num_examples: 62073 download_size: 6224765 dataset_size: 27849361 --- # Dataset Card for BiblePara ## Table of Contents - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Supported Tasks and Leaderboards](#supported-tasks-and-leaderboards) - [Languages](#languages) - [Dataset Structure](#dataset-structure) - [Data Instances](#data-instances) - [Data Fields](#data-fields) - [Data Splits](#data-splits) - [Dataset Creation](#dataset-creation) - [Curation Rationale](#curation-rationale) - [Source Data](#source-data) - [Annotations](#annotations) - [Personal and Sensitive Information](#personal-and-sensitive-information) - [Considerations for Using the Data](#considerations-for-using-the-data) - [Social Impact of Dataset](#social-impact-of-dataset) - [Discussion of Biases](#discussion-of-biases) - [Other Known Limitations](#other-known-limitations) - [Additional Information](#additional-information) - [Dataset Curators](#dataset-curators) - [Licensing Information](#licensing-information) - [Citation Information](#citation-information) - [Contributions](#contributions) ## Dataset Description - **Homepage:** http://opus.nlpl.eu/bible-uedin.php - **Repository:** None - **Paper:** https://link.springer.com/article/10.1007/s10579-014-9287-y - **Leaderboard:** [More Information Needed] - **Point of Contact:** [More Information Needed] ### Dataset Summary To load a language pair which isn't part of the config, all you need to do is specify the language code as pairs. You can find the valid pairs in Homepage section of Dataset Description: http://opus.nlpl.eu/bible-uedin.php E.g. `dataset = load_dataset("bible_para", lang1="fi", lang2="hi")` ### Supported Tasks and Leaderboards [More Information Needed] ### Languages [More Information Needed] ## Dataset Structure ### Data Instances Here are some examples of questions and facts: ### Data Fields [More Information Needed] ### Data Splits [More Information Needed] ## Dataset Creation ### Curation Rationale [More Information Needed] ### Source Data [More Information Needed] #### Initial Data Collection and Normalization [More Information Needed] #### Who are the source language producers? [More Information Needed] ### Annotations [More Information Needed] #### Annotation process [More Information Needed] #### Who are the annotators? [More Information Needed] ### Personal and Sensitive Information [More Information Needed] ## Considerations for Using the Data ### Social Impact of Dataset [More Information Needed] ### Discussion of Biases [More Information Needed] ### Other Known Limitations [More Information Needed] ## Additional Information ### Dataset Curators [More Information Needed] ### Licensing Information [More Information Needed] ### Citation Information [More Information Needed] ### Contributions Thanks to [@abhishekkrthakur](https://github.com/abhishekkrthakur) for adding this dataset.

BiblePara数据集是一个多语言的圣经平行语料库,支持多种语言对的翻译任务。数据集包含了多种语言的圣经文本,如德语、英语、法语、西班牙语、芬兰语、挪威语、印地语等。每个语言对的数据实例包括id和翻译文本,数据分割为训练集。数据集的加载方式可以通过指定语言代码对来实现。数据集的详细信息可以在其Homepage上找到。

提供机构:
Helsinki-NLP
原始信息汇总

数据集概述

  • 数据集名称: BiblePara
  • 语言: 多语言,包括但不限于acu, af, agr, ake, am, amu, ar, bg, bsn, cak, ceb, ch, chq, chr, cjp, cni, cop, crp, cs, da, de, dik, dje, djk, dop, ee, el, en, eo, es, et, eu, fi, fr, gbi, gd, gu, gv, he, hi, hr, hu, hy, id, is, it, ja, jak, jiv, kab, kbh, kek, kn, ko, la, lt, lv, mam, mi, ml, mr, my, ne, nhg, nl, no, ojb, pck, pes, pl, plt, pot, ppk, pt, quc, quw, ro, rom, ru, shi, sk, sl, sn, so, sq, sr, ss, sv, syr, te, th, tl, tmh, tr, uk, usp, vi, wal, wo, xh, zh, zu
  • 许可证: cc0-1.0
  • 多语言性: 多语言
  • 大小类别: 10K<n<100K
  • 源数据集: 原始
  • 任务类别: 翻译

数据集结构

  • 配置名称: de-en, en-fr, en-es, en-fi, en-no, en-hi
  • 特征:
    • id: 字符串类型
    • translation: 字符串类型,包含多种语言对
  • 分割:
    • train:
      • de-en: 62195个例子,17262178字节,下载大小5440713字节
      • en-fr: 62195个例子,17536445字节,下载大小5470044字节
      • en-es: 62191个例子,17105724字节,下载大小5418998字节
      • en-fi: 62026个例子,17486055字节,下载大小5506407字节
      • en-no: 62107个例子,16681323字节,下载大小5293164字节
      • en-hi: 62073个例子,27849361字节,下载大小6224765字节
搜集汇总
数据集介绍
构建方式
在机器翻译研究领域,平行语料库是模型训练与评估的基石。Helsinki-NLP/bible_para数据集基于多语言圣经译本构建,通过从公开的圣经翻译项目中收集不同语言的文本,并利用圣经章节的自然对齐特性,自动提取出句子级别的平行语料。该数据集涵盖了从阿卡德语到祖鲁语的百余种语言,每个语言对均以章节为单位进行对齐,确保了翻译对在语义和结构上的一致性。构建过程无需人工标注,完全依赖于已有译本的篇章结构,从而高效生成了大规模、高质量的多语言平行数据。
特点
该数据集的核心优势在于其极致的多语言覆盖与低资源语言支持。它囊括了超过100种语言,包括许多在通用语料库中稀缺的小众语言,如阿库语、阿格拉语和奇克索语,为低资源机器翻译研究提供了宝贵资源。每个语言对包含约6.2万个训练样本,规模适中但质量上乘。数据以CC0许可证发布,完全开放使用,消除了版权顾虑。此外,数据集提供灵活的加载方式,支持用户通过指定任意两种语言代码来创建定制化的平行语料对,极大地增强了其实用性与可扩展性。
使用方法
使用该数据集时,研究者可通过HuggingFace的datasets库便捷加载。例如,加载德语-英语对可直接调用load_dataset('bible_para', 'de-en')。对于预定义配置之外的语言组合,只需指定lang1和lang2参数,如load_dataset('bible_para', lang1='fi', lang2='hi')即可生成芬兰语-印地语平行语料。数据实例包含唯一的id字段和translation字段,后者以字典形式存储源语言与目标语言的对应文本。数据集仅提供训练集划分,适合直接用于训练序列到序列模型或进行跨语言迁移学习的实验。
背景与挑战
背景概述
在自然语言处理领域,平行语料库是机器翻译研究的基石,尤其对于低资源语言而言,高质量的双语对齐数据极为稀缺。BiblePara数据集由赫尔辛基大学自然语言处理小组(Helsinki-NLP)于2014年创建,依托于OPUS项目,旨在利用《圣经》这一被广泛翻译的宗教文本,构建大规模、多语种的平行语料库。该数据集覆盖超过100种语言,从德语、英语等资源丰富语言到阿库语、玛雅语等低资源语言,核心研究问题在于如何通过统一、对齐的语料推动机器翻译模型的跨语言泛化能力。其影响力深远,不仅为多语言翻译研究提供了标准化基准,还促进了低资源语言翻译技术的突破,成为学术论文(如发表于《Language Resources and Evaluation》)中频繁引用的资源。
当前挑战
BiblePara数据集所面临的挑战首先体现在领域适配性上:其文本源自《圣经》,宗教术语和文学化表达与日常语言存在显著差异,导致基于该语料训练的模型在通用翻译任务中可能产生偏差,难以直接迁移至新闻、科技等非宗教领域。构建过程中,语言对齐是一大难题,由于部分低资源语言缺乏标准化书写系统或存在方言变体,自动对齐算法易引入噪声,例如在阿姆哈拉语与祖鲁语的平行句对中,句子长度和结构差异导致对齐错误率较高。此外,数据规模不均衡,如英语-德语对包含约6.2万条样本,而某些罕见语言对可能仅千余条,这限制了模型在稀疏语言对上的泛化性能,亟需通过数据增强或跨语言迁移策略来缓解资源匮乏问题。
常用场景
经典使用场景
在自然语言处理领域,平行语料库是机器翻译研究的基石。Helsinki-NLP/bible_para数据集汇集了《圣经》文本在近百种语言间的对齐翻译对,为跨语言模型训练提供了规模可观的平行资源。其经典使用场景聚焦于神经机器翻译系统的开发与评估,研究者可借助该数据集对低资源语言对进行翻译模型的预训练或微调,尤其适用于那些缺乏大规模平行语料的语种组合,从而有效缓解数据稀疏性问题。
衍生相关工作
基于该数据集衍生出多项经典工作,包括多语言机器翻译模型(如M2M-100)在低资源语言上的适配研究、跨语言句子嵌入与表示学习的对比实验,以及语料库语言学中《圣经》翻译风格的计量分析。此外,它被广泛用作OPUS开源平行语料库的核心组件,支撑了如Tatoeba翻译挑战等基准测试的构建,并催生了针对圣经文本的特殊语义对齐方法,推动了篇章级翻译与术语一致性研究的进展。
数据集最近研究
最新研究方向
当前,多语言神经机器翻译(NMT)领域对低资源语言对的平行语料需求日益迫切,而《圣经》作为全球翻译最为广泛的文本之一,其多语言平行版本为跨语言研究提供了独特的数据基础。Helsinki-NLP/bible_para数据集凭借覆盖100余种语言(包括大量濒危及少数族群语言)的平行句对,成为推动低资源语言翻译模型训练与评估的核心资源。近期研究聚焦于利用该数据集的领域对齐特性(如宗教文本的语义一致性),探索跨语言表示迁移与零样本翻译的优化策略。同时,结合大规模预训练语言模型(如mT5、XLM-R)的微调实验表明,该语料在提升罕见语种翻译质量、缓解数据稀疏问题方面具有显著价值,为全球语言多样性保护与数字人文研究注入了新动能。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务