登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
D599_Japanese_English_Parallel_Corpus_Data
D599_Japanese_English_Parallel_Corpus_Data
收藏
Opencsg
2026-03-04 更新
2026-03-14 收录
平行语料库
机器翻译
数据链接:
https://www.opencsg.com/datasets/DatatangBeijing/D599_Japanese_English_Parallel_Corpus_Data
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
日英平行语料总计38 万组;排除了政治,黄色色情,个人信息等敏感词汇;可作为文本类数据分析的基础语料库,用于机器翻译等领域。
应用场景:
创建时间:
2026-03-04
相关数据集
NLPC-UOM/nllb-top25k-ensi-cleaned
机器翻译
语料库质量评估
该数据集是一个用于机器翻译任务的平行语料库,包含英语(en)和僧伽罗语(si)两种语言。数据集的大小在10K到100K之间。该数据集是通过网络挖掘得到的,并且对低资源语言的语料质量进行了详细分析。研究表明,网络挖掘的语料库在不同部分之间存在显著的质量差异,并且质量因语言和数据集而异。对于某些网络挖掘的数据集,使用其最高排名的25k部分训练的神经机器翻译(NMT)模型可以与人工整理的数据集相媲美。
Hugging Face
2024-06-17 更新
16
0
autoevaluate/autoeval-eval-aslg_pc12-default-007f32-95707146449
机器翻译
自动训练
--- type: predictions tags: - autotrain - evaluation datasets: - aslg_pc12 eval_info: task: translation model: HamdanXI/t5_small_gloss_merged_dataset_random_0.1 metrics: ['comet', 'bertscore']
Hugging Face
2023-10-17 更新
12
0
zaanind/sinhala_englsih_parrel_corpus
机器翻译
自然语言处理
该数据集包含大约80,000条英语-僧伽罗语翻译对,可用于训练机器翻译任务和其他自然语言处理应用。由于数据集规模较大,部分句子可能存在错误,因此在使用前建议进行数据清理和验证,以提高模型的可靠性。
Hugging Face
2024-07-16 更新
8
0
persiannlp/parsinlu_translation_en_fa
自然语言处理
机器翻译
--- annotations_creators: - expert-generated language_creators: - expert-generated language: - fa license: - cc-by-nc-sa-4.0 multilinguality: - fa - en size_categories: - 1K<n<10K source_datasets: - e
Hugging Face
2022-10-24 更新
15
0
HamdanXI/arb-eng-parallel-10k
机器翻译
语言对齐
该数据集包含阿拉伯语和英语的文本对,主要用于机器翻译或双语文本处理任务。数据集包含10,000个训练样本,总大小为4,293,258.42字节,下载大小为2,378,038字节。
Hugging Face
2023-11-22 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广