fra-hplt
收藏资源简介:
French HPLT 是一个用于语言模型预训练的高质量法语语料库。该数据集源自 HPLT Monolingual v3 项目的高质量网络爬取数据,经过严格筛选,包含 720,405 个文档,总计约 12.0B 字符、1.9B 单词和约 3.2B 估计词元。所有入选文档的 HPLT WDS 质量分数均不低于 10(质量分布的最高区间)。数据集为流式读取优化,并包含丰富的文档级元数据,包括:唯一标识符(id)、来源 MIME 类型(collection)、语言检测置信度(prob)、源 URL(url)、文档文本内容(text)、平均质量分数(score)、字符数(char_count)、词数(word_count)以及基于语域/体裁的概率分数字典(web_register),其中主导语域为概率最高的键。数据划分遵循 98%/1%/1% 的比例,分为训练集(620,405 文档,13个分片)、验证集(50,000 文档,1个分片)和测试集(50,000 文档,1个分片)。构建过程应用了多项质量过滤标准:文档长度限制在 50 至 100,000 字符之间,非字母字符比例不超过 50%,平均词长不低于 2.0 字符,并进行了基于 MinHash 的近重复移除。语料内容涵盖多种网络语域,其中机器翻译(MT)内容占比最高(约 43.03%),用户可通过元数据轻松过滤。数据来源主要为 HTML 页面(99.93%)。该数据集适用于文本生成、掩码填充等语言模型预训练任务。主要局限性包括:仅包含网络文本(不含书籍、维基百科等)、存在大量机器翻译内容、未进行超出源数据集的个人身份信息(PII)过滤。数据集遵循 CC0 1.0 许可协议。
数据集概述
数据集名称:French HPLT(法语 HPLT)
语言:法语(fr)
许可协议:CC0 1.0 Universal(公有领域,继承自 HPLT v3)
数据集规模:包含 720,405 个文档,总字数约 19 亿,总字符数约 120 亿,预估 token 数约 32 亿。
数据集大小类别:100K < n < 1M
任务类型:文本生成(text-generation)、掩码填充(fill-mask)
来源:基于 HPLT Monolingual v3 的高质量网络爬取数据构建,所有文档的 HPLT WDS 质量评分均 ≥ 10(质量分布顶部)。
数据划分
| 数据集划分 | 文档数量 | 分片数量 |
|---|---|---|
| train | 620,405 | 13 |
| validation | 50,000 | 1 |
| test | 50,000 | 1 |
数据集字段
| 字段名 | 类型 | 描述 |
|---|---|---|
id |
string | 文档的唯一 MD5 标识符 |
collection |
string | 源 MIME 类型(如 text/html) |
prob |
float | 语言检测置信度 |
url |
string | 源 URL |
text |
string | 文档文本 |
score |
float | 各分段的平均 HPLT WDS 质量评分(越高越好,所有文档 ≥ 10) |
char_count |
int | 字符数 |
word_count |
int | 按空格切分的词数 |
web_register |
dict[str, float] | 每种语域的概率分数(如 MT、NA、IN、IP、OP、HI、LY、SP、ID 等),值最高的键为主语域 |
构建流程
- 来源:HPLT v3 排序分片,按 WDS 质量评分降序排列。
- 质量过滤(下载时内联应用):
- 每个文档字符数在 50–100,000 之间。
- 非字母字符比例不超过 50%(Unicode 感知)。
- 平均词长不低于 2.0 个字符。
- 去重:
- HPLT v3 已应用全局近似去重。
- 额外进行 MinHash 近似去重(xxhash,相似度阈值 0.85,128 个排列,5-gram)。
语域分布
| 语域 | 文档数量 | 占比 | 含义 |
|---|---|---|---|
| MT | 310,002 | 43.03% | 机器翻译内容 |
| IP | 131,035 | 18.19% | 信息说服类 |
| IN | 120,755 | 16.76% | 信息描述类 |
| OP | 67,251 | 9.34% | 观点类 |
| NA | 55,815 | 7.75% | 叙事类 |
| HI | 20,726 | 2.88% | 操作指导类 |
| SP | 9,372 | 1.30% | 口语类 |
| ID | 5,228 | 0.73% | 互动讨论类 |
| LY | 221 | 0.03% | 抒情类 |
注意:可通过 web_register 字段过滤排除机器翻译内容(主语域为 MT 的文档约占 43.03%)。
来源集合类型
绝大多数文档(99.93%)来自 text/html 类型,极少部分来自 XML、EPUB、XHTML、RSS 等格式。
文档长度统计
| 指标 | 数值 |
|---|---|
| 平均文档长度(词) | 2,642 |
| 中位数文档长度(词) | 2,049 |
| 最小文档长度(词) | 361 |
| 最大文档长度(词) | 18,561 |
局限性
- 仅包含网络文本,不含书籍、Wikipedia 或结构化数据。
- 包含机器翻译内容(可通过主语域 MT 识别)。
- 未进行超出 HPLT 默认标准的 PII 过滤。
引用信息
bibtex @dataset{frenchHPLT_2026, author = {LeMoussel}, title = {French {HPLT}: French Corpus Document}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/LeMoussel/fra-hplt} }
@article{oepen2025hplt, title = {{HPLT} 3.0: Very Large-Scale Multilingual Resources for {LLM} and {MT}}, author = {Oepen, Stephan and others}, journal = {arXiv preprint arXiv:2511.01066}, year = {2025} }




