vitco-clean
收藏资源简介:
ViTco Clean 是一个经过清洗的越南语文本数据集,包含来自两个公开语料库的2,279,914篇文档,总大小为10.6 GB,以Parquet格式存储。该数据集基于原始语料库(HPLT v3和FinePDFs)进行了一系列清洗步骤:首先对文本进行归一化处理,然后测量并过滤掉非越南语散文内容,接着对归一化后的文本进行去重,最后覆盖个人标识符。清洗后的文档保留了所有溯源信息,包括来源、语言分数、音节数、变音符号状态、启发式指标、去重簇等字段。数据集适用于预训练、领域特定语料构建、越南语分词器训练、文档去重分析以及变音符号恢复等任务。用户可以通过Hugging Face Datasets库或DuckDB直接读取数据,支持流式加载以节省存储空间。
ViTco Clean is a cleaned Vietnamese text dataset containing 2,279,914 documents from two public corpora, with a total size of 10.6 GB stored in Parquet format. The dataset undergoes a series of cleaning steps based on the original corpora (HPLT v3 and FinePDFs): first, text normalization; then filtering out non-Vietnamese prose content; followed by deduplication of normalized text; and finally covering personal identifiers. Cleaned documents retain all provenance information, including fields such as source, language score, syllable count, diacritic status, heuristic indicators, and deduplication clusters. The dataset is suitable for tasks such as pretraining, domain-specific corpus construction, Vietnamese tokenizer training, document deduplication analysis, and diacritic restoration. Users can directly read the data via the Hugging Face Datasets library or DuckDB, with support for streaming loading to save storage space.
ViTco Clean 数据集详情
数据集概览
- 名称: ViTco Clean
- 语种: 越南语(单语)
- 规模: 2,279,914 篇文档,总大小 10.6 GB(Parquet 格式)
- 许可证: 每文档开放许可,需署名(per-document-open-permissive-attribution)
- 任务类别: 文本生成、掩码填充
- 数据来源: 网络爬取与 PDF 提取的公开语料
数据组成
| 来源 | 文档数 | 文件数 | 大小 |
|---|---|---|---|
| hplt3 | 1,901,519 | 11 | 2.5 GB |
| finepdfs | 378,395 | 50 | 8.1 GB |
| 总计 | 2,279,914 | 61 | 10.6 GB |
数据处理流程
对每篇文档依次执行以下四个步骤:
- 文本规范化: 统一拼写与格式
- 度量与筛选: 过滤非越南语散文(如样板文本、过短内容)
- 去重: 基于规范化文本的哈希值进行身份去重
- 覆盖个人标识符: 隐藏文档中可能存在的个人信息
筛选效果(基于 42 个数据分片的测量):
| 来源 | 输入文档 | 输出文档 | 保留率 |
|---|---|---|---|
| hplt3 | 1,839,058 | 1,067,860 | 58.1% |
| finepdfs | 796,802 | 269,592 | 33.8% |
| 合计 | 2,635,860 | 1,337,452 | 50.7% |
数据来源详情
HPLT v3(hplt3)
- 来自高性能语言技术项目的网页文本,基于 Internet Archive 和 Common Crawl 构建
- 未在 Hugging Face Hub 上,数据存储于 Sigma2 NIRD 数据湖
- 固定版本:
hplt3-5b2785d5b11c - 上游链接: https://hplt-project.org/datasets/v3.0
FinePDFs(finepdfs)
- 从 PDF 提取的文本,包括政府通告、法律文本、申报文件和课程材料
- 固定版本:
finepdfs-220bac3acbf0 - 上游链接: https://huggingface.co/datasets/HuggingFaceFW/finepdfs
未包含的源: CulturaX(因许可限制被丢弃)、MADLAD-400(因格式问题待处理)
数据结构
- 目录布局: 按来源分目录(
data/hplt3/、data/finepdfs/),文件名包含数据快照版本 - 文件格式: Parquet(列式存储)
- 配置文件:
default(全部)、hplt3、finepdfs - 根目录包含
parts.csv,逐文件记录来源、快照、文档数与大小
主要列字段
text: 文档文本url: 源 URLhost: 域名lang: ISO 639-3 语言代码(越南语为vie)lang_score: 越南语音节占比(0-1)n_syllables: 音节数diacritics: 声调符号状态(present / absent / mixed)dup_cluster: 文本去重哈希is_representative: 是否为重复组中的首个文档license_class: 许可证分类
数据用途
- 预训练 / 继续预训练: 用于越南语语言模型训练,可按音节数预算筛选
- 领域语料构建: 按
host分组提取法律、金融、医疗等特定领域文本 - 训练越南语分词器: 跨来源采样代表性文本
- 跨语料去重分析: 通过
dup_cluster识别不同来源间的重复内容 - 声调符号恢复与语言识别: 利用
diacritics与lang_score列训练相关模型
使用方式
- DuckDB: 支持远程直接查询 Parquet 文件(通过
hf://路径),无需下载 - Python: 支持流式加载(
load_dataset配合streaming=True),或按来源下载到本地 - 建议优先流式读取,整个数据集(10.6 GB)不适合普通磁盘一次性存放




