相关数据集
homersimpson/opensubtitles_fr
该数据集包含电影相关的元数据和翻译信息,具体包括电影的ID、年份、IMDb ID、字幕ID及其对应的语言(加泰罗尼亚语和法语)。数据集分为训练集、验证集和测试集,分别包含240000、30000和30000个示例。数据集的总下载大小为26004408字节,总大小为36369003字节。
Hugging Face2023-12-05 更新160
michsethowusu/kinyarwanda-tsonga_sentence-pairs
该数据集包含非洲语言句子对及其相似度评分,适用于机器翻译、句子对齐或其他自然语言处理任务。数据集基于NLLBv1构建,包含332,229行,每行有三个字段:相似度评分、基尼亚鲁旺达语句子和宗加语句子。可用于训练和评估机器学习模型,进行翻译、句子相似度计算和跨语言迁移学习等任务。
Hugging Face2025-03-30 更新130
MaroneAI/French-Wolof_Translation-Dataset
这个数据集包含了从法语到沃洛夫语的翻译对,数据经过精心收集和清洗,包括去除重复项和纠正不一致之处,确保数据集可靠且可以直接用于自动翻译模型的训练。数据适用于法语到沃洛夫语模型的微调训练、翻译模型的评估以及非洲语言的自然语言处理研究。
Hugging Face2025-10-08 更新80
GALE Phase 4 Arabic Weblog Parallel Sentences
Introduction GALE Phase 4 Arabic Weblog Parallel Sentences was developed by the Linguistic Data Consortium (LDC). Along with other corpora, the parallel text in this release comprised
DataCite Commons2021-07-01 更新160



