quickmt/finetranslations-sample-ar-en
收藏官方服务:
资源简介:
该数据集是从HuggingFaceFW/finetranslations数据集中提取的样本,经过过滤和句子分割处理,专门用于训练句子级别的机器翻译模型。数据集包含阿拉伯语(ar)和英语(en)的文本字段,以及一个浮点数字段(sco),可能表示翻译质量评分或其他相关指标。它支持阿拉伯语和英语之间的翻译任务,适用于自然语言处理中的机器翻译应用。数据规模较大,训练集包含1亿个示例,总大小约为45.4GB。
Sample of https://huggingface.co/datasets/HuggingFaceFW/finetranslations filtered and split into sentences by this script intended to be used for training sentence-level machine translation models.
提供机构:
quickmt


