官方服务:
资源简介:
A Sanskrit-English translation corpus
梵文-英文翻译语料库
应用场景:
创建时间:
2022-10-10
相关数据集
Napizia/Good-Sicilian-in-NLLB
该数据集名为Good Sicilian in the NLLB,主要关注西西里语的翻译质量。数据集由Project Napizia提供,旨在帮助语言模型学习符合西西里文学传统的语言。数据集包含从NLLB数据集中筛选出的高质量西西里语翻译对,并通过Napizia的翻译模型进行评分。数据集还提供了50,000对最佳翻译对的CSV文件。数据集来源于Meta AI发布的元数据,并经过Allen AI的处理
Hugging Face2025-08-16 更新150
smita1988/english-hindi-translation-dataset1
该数据集包含三个特征字段:input_ids,attention_mask和labels。数据集分为训练集、验证集和测试集,其中训练集包含1659083个示例,验证集包含520个示例,测试集包含2507个示例。整个数据集大小为1.4GB。
Hugging Face2025-02-17 更新100
JESC (Japanese-English Subtitle Corpus)
日英字幕语料库是一个大型的日英平行语料库,涵盖了代表性不足的对话对话领域。它包含超过 320 万个示例,使其成为同类中最大的免费数据集。该语料库是通过抓取和对齐网络上的字幕来组装的。
OpenDataLab2026-07-12 更新90
michsethowusu/kinyarwanda-tsonga_sentence-pairs
该数据集包含非洲语言句子对及其相似度评分,适用于机器翻译、句子对齐或其他自然语言处理任务。数据集基于NLLBv1构建,包含332,229行,每行有三个字段:相似度评分、基尼亚鲁旺达语句子和宗加语句子。可用于训练和评估机器学习模型,进行翻译、句子相似度计算和跨语言迁移学习等任务。
Hugging Face2025-03-30 更新130
CATIE-AQ/smoltalk2_aya_think_dataset_french_split
这是一个推理数据集,名为SFT/aya_dataset_Qwen3_32B_think,是HuggingFaceTB/smoltalk2数据集的子集,只包含法语数据。该数据集分为两个子集:english_raisonning和french_raisonning。english_raisonning子集包含法语的提问和回答以及英语的推理,而french_raisonning子集包含法语的提问和回答以
Hugging Face2025-07-29 更新90



