数据链接:
官方服务:
资源简介:
Parallel datasets of crisis events in 2 and 4 languages.
应用场景:
创建时间:
2020-05-29
相关数据集
community-datasets/setimes
SETimes数据集是一个包含英语和东南欧语言(如保加利亚语、波斯尼亚语、希腊语、克罗地亚语、马其顿语、罗马尼亚语、阿尔巴尼亚语、塞尔维亚语和土耳其语)的平行语料库。该数据集是多语言的,包含超过10万条但少于100万条数据记录。数据集的主要任务是翻译任务,支持多种语言对的翻译。每个语言对的训练数据大小、下载大小和数据集大小在配置信息中详细列出。数据集的许可证为CC BY-SA 4.0。
Hugging Face2024-06-26 更新470
Indic-Data
这是一个由各种印度来源和印度文学积累而成的数据集,包括古典印度文学文本、印度数学家的数学论文和经文、相关研究论文和数据源等。数据集目前包含的区域语言数据有古吉拉特语和马拉地语,以及英语到孟加拉语、马拉雅拉姆语、泰米尔语、泰卢固语和乌尔都语的平行语料库。
Hugging Face2025-08-02 更新120
UFAL Parallel Corpus of North Levantine 1.0
This corpus contains multiparallel sentences in English, French, German, Greek, Spanish, and Standard Arabic. The sentences have been selected from the [OpenSubtitles2018](http://opus.nlpl.eu/OpenSubt
SSH Open MarketPlace2023-10-13 更新90
GALE Phase 4 Arabic Weblog Parallel Sentences
Introduction GALE Phase 4 Arabic Weblog Parallel Sentences was developed by the Linguistic Data Consortium (LDC). Along with other corpora, the parallel text in this release comprised
DataCite Commons2021-07-01 更新160
dumitrescustefan/ro_sts_parallel
RO-STS-Parallel数据集是一个罗马尼亚语和英语的平行语料库,该数据集是通过将STS英语数据集翻译成罗马尼亚语而获得的。数据集包含17256个罗马尼亚语和英语的句子对。数据集的结构包括训练集、验证集和测试集,分别包含11498、3000和2758个句子对。数据集的创建过程包括使用谷歌翻译引擎进行自动翻译,然后由人工志愿者进行手动检查和校正。数据集的许可证为CC BY-SA 4.0。
Hugging Face2024-01-18 更新110



