遇见数据集

fra-hplt

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

French HPLT 是一个用于语言模型预训练的高质量法语语料库。该数据集源自 HPLT Monolingual v3 项目的高质量网络爬取数据,经过严格筛选,包含 720,405 个文档,总计约 12.0B 字符、1.9B 单词和约 3.2B 估计词元。所有入选文档的 HPLT WDS 质量分数均不低于 10(质量分布的最高区间)。数据集为流式读取优化,并包含丰富的文档级元数据,包括:唯一标识符(id)、来源 MIME 类型(collection)、语言检测置信度(prob)、源 URL(url)、文档文本内容(text)、平均质量分数(score)、字符数(char_count)、词数(word_count)以及基于语域/体裁的概率分数字典(web_register),其中主导语域为概率最高的键。数据划分遵循 98%/1%/1% 的比例,分为训练集(620,405 文档,13个分片)、验证集(50,000 文档,1个分片)和测试集(50,000 文档,1个分片)。构建过程应用了多项质量过滤标准:文档长度限制在 50 至 100,000 字符之间,非字母字符比例不超过 50%,平均词长不低于 2.0 字符,并进行了基于 MinHash 的近重复移除。语料内容涵盖多种网络语域,其中机器翻译(MT)内容占比最高(约 43.03%),用户可通过元数据轻松过滤。数据来源主要为 HTML 页面(99.93%)。该数据集适用于文本生成、掩码填充等语言模型预训练任务。主要局限性包括:仅包含网络文本(不含书籍、维基百科等)、存在大量机器翻译内容、未进行超出源数据集的个人身份信息(PII)过滤。数据集遵循 CC0 1.0 许可协议。

创建时间:
2026-06-22
原始信息汇总

数据集概述

数据集名称:French HPLT(法语 HPLT)

语言:法语(fr)

许可协议:CC0 1.0 Universal(公有领域,继承自 HPLT v3)

数据集规模:包含 720,405 个文档,总字数约 19 亿,总字符数约 120 亿,预估 token 数约 32 亿。

数据集大小类别:100K < n < 1M

任务类型:文本生成(text-generation)、掩码填充(fill-mask)

来源:基于 HPLT Monolingual v3 的高质量网络爬取数据构建,所有文档的 HPLT WDS 质量评分均 ≥ 10(质量分布顶部)。

数据划分

数据集划分 文档数量 分片数量
train 620,405 13
validation 50,000 1
test 50,000 1

数据集字段

字段名 类型 描述
id string 文档的唯一 MD5 标识符
collection string 源 MIME 类型(如 text/html
prob float 语言检测置信度
url string 源 URL
text string 文档文本
score float 各分段的平均 HPLT WDS 质量评分(越高越好,所有文档 ≥ 10)
char_count int 字符数
word_count int 按空格切分的词数
web_register dict[str, float] 每种语域的概率分数(如 MT、NA、IN、IP、OP、HI、LY、SP、ID 等),值最高的键为主语域

构建流程

  • 来源:HPLT v3 排序分片,按 WDS 质量评分降序排列。
  • 质量过滤(下载时内联应用):
    • 每个文档字符数在 50–100,000 之间。
    • 非字母字符比例不超过 50%(Unicode 感知)。
    • 平均词长不低于 2.0 个字符。
  • 去重
    • HPLT v3 已应用全局近似去重。
    • 额外进行 MinHash 近似去重(xxhash,相似度阈值 0.85,128 个排列,5-gram)。

语域分布

语域 文档数量 占比 含义
MT 310,002 43.03% 机器翻译内容
IP 131,035 18.19% 信息说服类
IN 120,755 16.76% 信息描述类
OP 67,251 9.34% 观点类
NA 55,815 7.75% 叙事类
HI 20,726 2.88% 操作指导类
SP 9,372 1.30% 口语类
ID 5,228 0.73% 互动讨论类
LY 221 0.03% 抒情类

注意:可通过 web_register 字段过滤排除机器翻译内容(主语域为 MT 的文档约占 43.03%)。

来源集合类型

绝大多数文档(99.93%)来自 text/html 类型,极少部分来自 XML、EPUB、XHTML、RSS 等格式。

文档长度统计

指标 数值
平均文档长度(词) 2,642
中位数文档长度(词) 2,049
最小文档长度(词) 361
最大文档长度(词) 18,561

局限性

  • 仅包含网络文本,不含书籍、Wikipedia 或结构化数据。
  • 包含机器翻译内容(可通过主语域 MT 识别)。
  • 未进行超出 HPLT 默认标准的 PII 过滤。

引用信息

bibtex @dataset{frenchHPLT_2026, author = {LeMoussel}, title = {French {HPLT}: French Corpus Document}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/LeMoussel/fra-hplt} }

@article{oepen2025hplt, title = {{HPLT} 3.0: Very Large-Scale Multilingual Resources for {LLM} and {MT}}, author = {Oepen, Stephan and others}, journal = {arXiv preprint arXiv:2511.01066}, year = {2025} }

搜集汇总
数据集介绍
fra-hplt 数据集图片
构建方式
French HPLT语料库源自HPLT Monolingual v3高质量网络爬取数据,通过对原始文档进行精细筛选与净化构建而成。构建过程首先设定严格的长度阈值,保留字符数在50至100,000之间的文档,并过滤掉非字母字符占比超过50%的样本,同时确保平均词长不低于2.0个字符。随后,依托HPLT v3已有的全局近似去重机制,并额外应用MinHash算法(采用xxhash哈希、相似度阈值0.85、128个置换、5-gram特征)进行近重复消除,最终获得720,405篇代表法语网络文本高质区域的语料。
特点
该数据集的核心特色在于其卓越的质量控制与丰富的元数据标注。所有文档的HPLT WDS质量评分均不低于10分,处于质量分布的顶端。每条数据除包含文本内容与来源URL外,还提供语言置信度、字符与词数统计、质量分数以及细粒度的语域概率分布(如信息说明、叙述、机器翻译等九类),其中机器翻译内容占比约43%,用户可据此灵活过滤。数据集以Parquet分片形式组织,支持流式加载,训练集、验证集与测试集按98%、1%、1%的比例划分,规模分别约为62万、5万与5万篇文档。
使用方法
用户可通过HuggingFace Datasets库便捷调用,推荐采用流式模式以节省磁盘空间,例如使用`load_dataset('LeMoussel/fra-hplt', split='train', streaming=True)`加载训练集,并用`.take()`方法预览样本。数据集各字段(如'url'、'text'、'web_register')可直接访问,如需排除机器翻译内容,可借助`.filter()`函数依据语域字典中的主导标签进行筛选:`ds.filter(lambda x: max(x['web_register'], key=x['web_register'].get) != 'MT')`。该语料适用于法语语言模型的预训练、文本生成及掩码填充等任务,其CC0许可协议保障了广泛的使用自由。
背景与挑战
背景概述
随着大规模语言模型在多语言场景中的广泛应用,高质量、流式可用的预训练语料库成为推动法语自然语言处理发展的重要基石。2026年发布的fra-hplt数据集由LeMoussel主导构建,依托HPLT项目第三版单语语料库,通过严格的Web爬取、质量筛选与去重流程,汇聚了72万余篇法语文档,总计约12亿字符与19亿词。该语料库聚焦于网域文本,以CC0许可协议开源,旨在为法语预训练任务提供高保真、元数据丰富的流式数据集,其发布对提升法语LLM与机器翻译系统的训练数据质量具有显著影响。
当前挑战
fra-hplt数据集所面对的领域挑战主要体现在两方面:其一,法语预训练语料长期面临来源混杂、低质内容泛滥的问题,如何从海量网络爬取数据中高效提取语义连贯、语法规范的文本是关键难点;其二,语料中高达43%的机器翻译内容可能引入噪声与失真,需依赖注册类型评分进行精准过滤。在构建过程中,数据集创建者遭遇了文档长度分布不均、字符边界模糊等处理难题,并通过设定50至10万字符范围、最多50%非字母字符比例及最小平均词长2.0等阈值进行质量把控,同时利用全局与局部MinHash去重消除冗余,最终平衡了数据规模与纯净度。
常用场景
经典使用场景
fra-hplt数据集汇聚了72万余篇源自高质量网络爬取的法语文档,为法语自然语言处理研究提供了丰沛的预训练语料。其经典使用场景在于作为大规模语言模型(LLM)的法语预训练基础,研究人员可直接利用该数据集对Transformer架构模型进行领域自适应训练,或结合其丰富的元数据(如语言置信度、质量评分、文本体裁分布)进行数据筛选与均衡采样,以提升模型在法语上的语言建模能力与生成质量。
实际应用
在实际应用中,fra-hplt数据集可服务于法语智能助手、翻译系统及内容审核工具的开发。机器翻译领域可利用其高质量法语文本作为目标语言数据,提升译文的流畅度与自然度;同时,通过剔除机器翻译标签(MT)的文本,研究者可构建更纯净的人工创作语料用于评估。此外,教育科技界可基于该语料训练法语语法纠错模型或文本难度分级系统,帮助学习者提升语言能力,而媒体分析领域则可借助其叙事型(NA)与观点型(OP)文本进行舆情监测与主题建模。
衍生相关工作
fra-hplt数据集衍生了多项具有影响力的研究工作。其中,基于HPLT v3管道构建的质量过滤与去重流程被后续多语言语料库项目采纳,成为网络文本清洗的基准方法之一。研究者利用其文体注册标签训练了法语语域分类器,该分类器可自动标注新文档的文本类型,广泛应用于内容策展与语料库语言学。此外,部分工作聚焦于评估预训练语料中机器翻译内容的可识别性及其对下游任务的影响,提出了基于Web Register概率分布的过滤策略,这些成果进一步推动了对话式AI和跨语言语义理解的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务