登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
D315_Chinese_Urdu_Parallel_Corpus_Data
D315_Chinese_Urdu_Parallel_Corpus_Data
收藏
Opencsg
2026-03-04 更新
2026-03-14 收录
平行语料库
机器翻译
数据链接:
https://www.opencsg.com/datasets/DatatangBeijing/D315_Chinese_Urdu_Parallel_Corpus_Data
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
中文-乌尔都语平行语料数据包括98万组中文、乌尔都语平行互译语料,数据存储格式为txt文档。已进行数据清洗脱敏质检,可作为文本类数据分析的基础语料库,用于机器翻译等领域。
应用场景:
创建时间:
2026-03-04
相关数据集
Napizia/Good-Sicilian-in-NLLB
机器翻译
自然语言处理
该数据集名为Good Sicilian in the NLLB,主要关注西西里语的翻译质量。数据集由Project Napizia提供,旨在帮助语言模型学习符合西西里文学传统的语言。数据集包含从NLLB数据集中筛选出的高质量西西里语翻译对,并通过Napizia的翻译模型进行评分。数据集还提供了50,000对最佳翻译对的CSV文件。数据集来源于Meta AI发布的元数据,并经过Allen AI的处理
Hugging Face
2025-08-16 更新
15
0
smita1988/english-hindi-translation-dataset1
机器翻译
自然语言处理
该数据集包含三个特征字段:input_ids,attention_mask和labels。数据集分为训练集、验证集和测试集,其中训练集包含1659083个示例,验证集包含520个示例,测试集包含2507个示例。整个数据集大小为1.4GB。
Hugging Face
2025-02-17 更新
10
0
JESC (Japanese-English Subtitle Corpus)
自然语言处理
机器翻译
日英字幕语料库是一个大型的日英平行语料库,涵盖了代表性不足的对话对话领域。它包含超过 320 万个示例,使其成为同类中最大的免费数据集。该语料库是通过抓取和对齐网络上的字幕来组装的。
OpenDataLab
2026-07-12 更新
9
0
michsethowusu/kinyarwanda-tsonga_sentence-pairs
自然语言处理
机器翻译
该数据集包含非洲语言句子对及其相似度评分,适用于机器翻译、句子对齐或其他自然语言处理任务。数据集基于NLLBv1构建,包含332,229行,每行有三个字段:相似度评分、基尼亚鲁旺达语句子和宗加语句子。可用于训练和评估机器学习模型,进行翻译、句子相似度计算和跨语言迁移学习等任务。
Hugging Face
2025-03-30 更新
13
0
CATIE-AQ/smoltalk2_aya_think_dataset_french_split
自然语言处理
机器翻译
这是一个推理数据集,名为SFT/aya_dataset_Qwen3_32B_think,是HuggingFaceTB/smoltalk2数据集的子集,只包含法语数据。该数据集分为两个子集:english_raisonning和french_raisonning。english_raisonning子集包含法语的提问和回答以及英语的推理,而french_raisonning子集包含法语的提问和回答以
Hugging Face
2025-07-29 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广