相关数据集
homersimpson/opensubtitles_fr
该数据集包含电影相关的元数据和翻译信息,具体包括电影的ID、年份、IMDb ID、字幕ID及其对应的语言(加泰罗尼亚语和法语)。数据集分为训练集、验证集和测试集,分别包含240000、30000和30000个示例。数据集的总下载大小为26004408字节,总大小为36369003字节。
Hugging Face2023-12-05 更新160
GALE Phase 4 Arabic Weblog Parallel Sentences
Introduction GALE Phase 4 Arabic Weblog Parallel Sentences was developed by the Linguistic Data Consortium (LDC). Along with other corpora, the parallel text in this release comprised
DataCite Commons2021-07-01 更新160
MaroneAI/French-Wolof_Translation-Dataset
这个数据集包含了从法语到沃洛夫语的翻译对,数据经过精心收集和清洗,包括去除重复项和纠正不一致之处,确保数据集可靠且可以直接用于自动翻译模型的训练。数据适用于法语到沃洛夫语模型的微调训练、翻译模型的评估以及非洲语言的自然语言处理研究。
Hugging Face2025-10-08 更新80
YogeLiu/zh-en-translation-dataset
该数据集包含源字符串(src)和目标字符串(tgt)两个特征,适用于机器翻译等序列到序列的任务。训练集包含1048574个示例,数据集总大小为约224MB。
Hugging Face2025-07-15 更新160
NeutrinoPit/OpenSubtitles2024-en-ar-batch53
该数据集包含两种语言的文本数据:英语(en)和阿拉伯语(ar)。它包含一个训练集,共有100万个示例,文件大小为约100MB。数据集的具体内容未在README中描述,但可以推断它是一个用于语言处理的文本数据集。
Hugging Face2025-03-04 更新80



