遇见数据集

DocHPLT-v3-clean

收藏
Hugging Face2026-09-14 更新2026-09-15 收录
官方服务:

资源简介:

DocHPLT v3 cleaned 是一个清洗和重新格式化的多语言文档级平行语料数据集,基于 DocHPLTv3 原始语料构建。其目的是为大型语言模型(LLM)训练或文档级神经机器翻译(NMT)提供高质量、易于使用的多语言文本数据。数据集覆盖包括英语、保加利亚语、波斯尼亚语、加泰罗尼亚语、捷克语、丹麦语、希腊语、爱沙尼亚语、芬兰语、爱尔兰语、加利西亚语、克罗地亚语、匈牙利语、冰岛语、格鲁吉亚语、立陶宛语、拉脱维亚语、马其顿语、马耳他语、挪威语(巴克摩语和新挪威语)、罗马尼亚语、斯洛伐克语、斯洛文尼亚语、阿尔巴尼亚语、塞尔维亚语、土耳其语、乌克兰语等多种欧洲语言。该数据集采用 CC0-1.0 许可证,支持自由使用。

DocHPLT v3 cleaned is a cleaned and reformatted multilingual document-level parallel corpus dataset built from the original DocHPLTv3 corpus. It aims to provide high-quality, easy-to-use multilingual text data for large language model (LLM) training or document-level neural machine translation (NMT). The dataset covers multiple European languages including English, Bulgarian, Bosnian, Catalan, Czech, Danish, Greek, Estonian, Finnish, Irish, Galician, Croatian, Hungarian, Icelandic, Georgian, Lithuanian, Latvian, Macedonian, Maltese, Norwegian (Bokmål and Nynorsk), Romanian, Slovak, Slovenian, Albanian, Serbian, Turkish, Ukrainian, and more. It is licensed under CC0-1.0, allowing free use.

提供机构:
HPLT
创建时间:
2026-09-14
原始信息汇总

DocHPLT v3 cleaned 数据集概述

基本信息

  • 数据集名称:DocHPLT v3 cleaned
  • 许可证:cc0-1.0
  • 任务类别:translation(翻译)

数据集描述

  • 该数据集是 DocHPLTv3 的清洗和重新格式化版本。
  • 适用于 LLM 训练或文档级 NMT(神经机器翻译)训练。

支持语言

包含以下语言:

  • en(英语)
  • bg(保加利亚语)
  • bs(波斯尼亚语)
  • ca(加泰罗尼亚语)
  • cs(捷克语)
  • da(丹麦语)
  • el(希腊语)
  • et(爱沙尼亚语)
  • eu(巴斯克语)
  • fi(芬兰语)
  • ga(爱尔兰语)
  • gl(加利西亚语)
  • hr(克罗地亚语)
  • hu(匈牙利语)
  • is(冰岛语)
  • ka(格鲁吉亚语)
  • lt(立陶宛语)
  • lv(拉脱维亚语)
  • mk(马其顿语)
  • mt(马耳他语)
  • nb(挪威博克马尔语)
  • nn(挪威尼诺斯克语)
  • ro(罗马尼亚语)
  • sk(斯洛伐克语)
  • sl(斯洛文尼亚语)
  • sq(阿尔巴尼亚语)
  • sr(塞尔维亚语)
  • tr(土耳其语)
  • uk(乌克兰语)
搜集汇总
数据集介绍
DocHPLT-v3-clean 数据集图片
构建方式
DocHPLT-v3-clean的构建以DocHPLT-v3原始资源为基底,通过系统化的清洗与重新格式化流程,去除噪声、冗余标记及不规范结构,使文档恢复至连贯、整洁的状态。该过程兼顾多语言语料的语言特性,确保每份文档在保留原始语义的同时,适配大规模语言模型训练与文档级神经机器翻译任务的数据规范,从而形成结构统一、质量可控的衍生数据集。
特点
本数据集的核心特质在于其多语言覆盖与文档级粒度的结合,涵盖英语、保加利亚语、加泰罗尼亚语等三十余种欧洲语言,并采用cc0-1.0许可协议,赋予使用者高度的开放性与灵活性。清洗后的文本在消除碎片化与格式异常方面表现突出,适合需要长上下文建模的翻译与生成任务,亦为低资源语言的研究提供了可靠且规范的语料支持。
使用方法
使用者可依托HuggingFace平台直接加载DocHPLT-v3-clean数据集,将其作为文档级机器翻译或大语言模型训练的输入语料。在实际操作中,建议依据任务目标选择相应语言子集,并遵循文档边界进行序列构建,以充分利用其清洗后的连贯性。该数据集亦适用于跨语言迁移学习与多语言模型的微调,为翻译质量评估及文档级对齐研究提供基础数据支撑。
背景与挑战
背景概述
面向多语言文档级机器翻译与大规模语言模型训练的需求,DocHPLT-v3-clean数据集于2024年前后由HPLT项目团队构建并发布。该数据集源于DocHPLT v3,经清洗与重格式化处理,覆盖英语、保加利亚语、加泰罗尼亚语等三十余种欧洲语言,旨在为文档级神经机器翻译和语言模型预训练提供高质量平行语料。作为HPLT计划的重要组成部分,其核心研究问题在于突破传统句级平行语料的局限,推动文档级翻译建模与跨语言知识迁移,对低资源语言处理和多语言自然语言生成领域具有显著的支撑与推动作用。
当前挑战
该数据集所应对的领域问题在于文档级机器翻译与语言模型训练中平行语料的稀缺与质量参差。构建过程中,多语言文档对齐面临语言结构差异、篇章连贯性保持及噪声过滤等困难;清洗与重格式化需在保留文档结构的同时消除重复、乱码与不对齐片段。此外,覆盖三十余种语言导致资源不均衡,低资源语言的文档级平行数据尤为匮乏,对齐精度与领域适应性亦构成持续挑战,对下游翻译质量和模型泛化能力形成制约。
常用场景
经典使用场景
在自然语言处理领域,文档级机器翻译与大型语言模型训练对高质量、连贯的跨语言文档数据需求迫切。DocHPLT-v3-clean作为经过清洗与重格式化的文档级平行语料库,其经典使用场景在于为文档级神经机器翻译系统提供训练与评估资源。该数据集涵盖三十余种欧洲语言,保留了文档内部的篇章结构,使模型能够捕捉跨句依赖与上下文连贯性,从而突破传统句级翻译的局限。研究者常将其用于训练端到端的文档翻译模型,或微调多语言大模型以提升长文本生成与翻译的一致性。
解决学术问题
该数据集主要解决了文档级机器翻译研究中长期存在的语料稀缺与噪声干扰问题。既往公开的平行语料多停留于句级对齐,缺乏文档级篇章信息,且原始网络抓取数据常含格式混乱、重复与低质内容,制约了模型对连贯语义的建模能力。DocHPLT-v3-clean通过系统化清洗与重格式化,提供了语言覆盖广泛、篇章结构完整的平行文档,为探究跨句指代、语篇衔接与文档级解码等学术问题奠定了数据基础。其意义在于推动了文档级翻译从理论探索向可复现实验的转变,并促进了多语言低资源场景下的迁移学习研究。
衍生相关工作
基于DocHPLT-v3-clean,研究者已衍生出一系列经典工作。例如,在文档级机器翻译领域,有研究利用该数据集训练层次化注意力模型与篇章感知变换器,显著提升了长文档翻译的连贯性指标。在多语言大模型方向,部分工作将其纳入预训练混合语料,验证了文档级数据对低资源语言迁移的增益。同时,该数据集也激发了文档对齐与篇章切分算法的改进,相关成果发表于机器翻译与自然语言处理顶级会议,形成了从数据清洗到模型评估的完整研究链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务