DocHPLT-v3-clean
收藏资源简介:
DocHPLT v3 cleaned 是一个清洗和重新格式化的多语言文档级平行语料数据集,基于 DocHPLTv3 原始语料构建。其目的是为大型语言模型(LLM)训练或文档级神经机器翻译(NMT)提供高质量、易于使用的多语言文本数据。数据集覆盖包括英语、保加利亚语、波斯尼亚语、加泰罗尼亚语、捷克语、丹麦语、希腊语、爱沙尼亚语、芬兰语、爱尔兰语、加利西亚语、克罗地亚语、匈牙利语、冰岛语、格鲁吉亚语、立陶宛语、拉脱维亚语、马其顿语、马耳他语、挪威语(巴克摩语和新挪威语)、罗马尼亚语、斯洛伐克语、斯洛文尼亚语、阿尔巴尼亚语、塞尔维亚语、土耳其语、乌克兰语等多种欧洲语言。该数据集采用 CC0-1.0 许可证,支持自由使用。
DocHPLT v3 cleaned is a cleaned and reformatted multilingual document-level parallel corpus dataset built from the original DocHPLTv3 corpus. It aims to provide high-quality, easy-to-use multilingual text data for large language model (LLM) training or document-level neural machine translation (NMT). The dataset covers multiple European languages including English, Bulgarian, Bosnian, Catalan, Czech, Danish, Greek, Estonian, Finnish, Irish, Galician, Croatian, Hungarian, Icelandic, Georgian, Lithuanian, Latvian, Macedonian, Maltese, Norwegian (Bokmål and Nynorsk), Romanian, Slovak, Slovenian, Albanian, Serbian, Turkish, Ukrainian, and more. It is licensed under CC0-1.0, allowing free use.
DocHPLT v3 cleaned 数据集概述
基本信息
- 数据集名称:DocHPLT v3 cleaned
- 许可证:cc0-1.0
- 任务类别:translation(翻译)
数据集描述
- 该数据集是 DocHPLTv3 的清洗和重新格式化版本。
- 适用于 LLM 训练或文档级 NMT(神经机器翻译)训练。
支持语言
包含以下语言:
- en(英语)
- bg(保加利亚语)
- bs(波斯尼亚语)
- ca(加泰罗尼亚语)
- cs(捷克语)
- da(丹麦语)
- el(希腊语)
- et(爱沙尼亚语)
- eu(巴斯克语)
- fi(芬兰语)
- ga(爱尔兰语)
- gl(加利西亚语)
- hr(克罗地亚语)
- hu(匈牙利语)
- is(冰岛语)
- ka(格鲁吉亚语)
- lt(立陶宛语)
- lv(拉脱维亚语)
- mk(马其顿语)
- mt(马耳他语)
- nb(挪威博克马尔语)
- nn(挪威尼诺斯克语)
- ro(罗马尼亚语)
- sk(斯洛伐克语)
- sl(斯洛文尼亚语)
- sq(阿尔巴尼亚语)
- sr(塞尔维亚语)
- tr(土耳其语)
- uk(乌克兰语)




