相关数据集
Helsinki-NLP/opus_books
--- annotations_creators: - found language_creators: - found language: - ca - de - el - en - eo - es - fi - fr - hu - it - nl - 'no' - pl - pt - ru - sv license: - other multilinguality: - multilingua
Hugging Face2024-03-29 更新2020
Helsinki-NLP/tatoeba_mt
Tatoeba翻译挑战是一个多语言机器翻译基准数据集,数据来源于Tatoeba.org用户贡献的翻译,并通过OPUS平台整理成平行语料库。该数据集包含数百种语言对的测试和开发数据,并持续更新。数据集的结构为TAB分隔的文件,包含源语言和目标语言的ISO-639-3代码、源语言文本和目标语言文本。数据集的目标是提供高语言覆盖率的测试集,适用于低资源语言和多语言机器翻译任务。
Hugging Face2024-10-08 更新740
Helsinki-NLP/bianet
Bianet是一个新的开源平行语料库,包含从Bianet杂志收集的新闻文章,该杂志是一家在线报纸,发布土耳其新闻,通常附带其英语和库尔德语翻译。该语料库包含土耳其语、库尔德语和英语的平行新闻文章。Bianet收集了3,214篇土耳其语文章及其句子对齐的库尔德语或英语翻译。数据集的语言包括英语(en)、库尔德语(ku)和土耳其语(tr)。
Hugging Face2024-02-23 更新280
Helsinki-NLP/opus-100
OPUS-100 是一个多语言翻译数据集,涵盖了广泛的语言和语言对。数据集的大小从少于1K到超过10M不等,主要用于翻译任务。数据来源于扩展的数据集。README 文件中列出了每个语言对的配置名称、特征、分割和大小。
Hugging Face2024-02-28 更新1280
Helsinki-NLP/opus_paracrawl
OpusParaCrawl数据集是一个多语言的平行语料库,包含42种语言和43个双语对。数据集总共有59,996个文件,包含56.11G的token和3.13G的句子片段。数据集主要用于翻译任务,用户可以通过指定语言对来加载特定的语料库。数据集的许可证为Creative Commons CC0(无权利保留)。
Hugging Face2024-02-22 更新300



