遇见数据集

vitco-clean

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

ViTco Clean 是一个经过清洗的越南语文本数据集,包含来自两个公开语料库的2,279,914篇文档,总大小为10.6 GB,以Parquet格式存储。该数据集基于原始语料库(HPLT v3和FinePDFs)进行了一系列清洗步骤:首先对文本进行归一化处理,然后测量并过滤掉非越南语散文内容,接着对归一化后的文本进行去重,最后覆盖个人标识符。清洗后的文档保留了所有溯源信息,包括来源、语言分数、音节数、变音符号状态、启发式指标、去重簇等字段。数据集适用于预训练、领域特定语料构建、越南语分词器训练、文档去重分析以及变音符号恢复等任务。用户可以通过Hugging Face Datasets库或DuckDB直接读取数据,支持流式加载以节省存储空间。

ViTco Clean is a cleaned Vietnamese text dataset containing 2,279,914 documents from two public corpora, with a total size of 10.6 GB stored in Parquet format. The dataset undergoes a series of cleaning steps based on the original corpora (HPLT v3 and FinePDFs): first, text normalization; then filtering out non-Vietnamese prose content; followed by deduplication of normalized text; and finally covering personal identifiers. Cleaned documents retain all provenance information, including fields such as source, language score, syllable count, diacritic status, heuristic indicators, and deduplication clusters. The dataset is suitable for tasks such as pretraining, domain-specific corpus construction, Vietnamese tokenizer training, document deduplication analysis, and diacritic restoration. Users can directly read the data via the Hugging Face Datasets library or DuckDB, with support for streaming loading to save storage space.

创建时间:
2026-08-19
原始信息汇总

ViTco Clean 数据集详情

数据集概览

  • 名称: ViTco Clean
  • 语种: 越南语(单语)
  • 规模: 2,279,914 篇文档,总大小 10.6 GB(Parquet 格式)
  • 许可证: 每文档开放许可,需署名(per-document-open-permissive-attribution)
  • 任务类别: 文本生成、掩码填充
  • 数据来源: 网络爬取与 PDF 提取的公开语料

数据组成

来源 文档数 文件数 大小
hplt3 1,901,519 11 2.5 GB
finepdfs 378,395 50 8.1 GB
总计 2,279,914 61 10.6 GB

数据处理流程

对每篇文档依次执行以下四个步骤:

  1. 文本规范化: 统一拼写与格式
  2. 度量与筛选: 过滤非越南语散文(如样板文本、过短内容)
  3. 去重: 基于规范化文本的哈希值进行身份去重
  4. 覆盖个人标识符: 隐藏文档中可能存在的个人信息

筛选效果(基于 42 个数据分片的测量):

来源 输入文档 输出文档 保留率
hplt3 1,839,058 1,067,860 58.1%
finepdfs 796,802 269,592 33.8%
合计 2,635,860 1,337,452 50.7%

数据来源详情

HPLT v3(hplt3)

  • 来自高性能语言技术项目的网页文本,基于 Internet Archive 和 Common Crawl 构建
  • 未在 Hugging Face Hub 上,数据存储于 Sigma2 NIRD 数据湖
  • 固定版本: hplt3-5b2785d5b11c
  • 上游链接: https://hplt-project.org/datasets/v3.0

FinePDFs(finepdfs)

  • 从 PDF 提取的文本,包括政府通告、法律文本、申报文件和课程材料
  • 固定版本: finepdfs-220bac3acbf0
  • 上游链接: https://huggingface.co/datasets/HuggingFaceFW/finepdfs

未包含的源: CulturaX(因许可限制被丢弃)、MADLAD-400(因格式问题待处理)

数据结构

  • 目录布局: 按来源分目录(data/hplt3/data/finepdfs/),文件名包含数据快照版本
  • 文件格式: Parquet(列式存储)
  • 配置文件: default(全部)、hplt3finepdfs
  • 根目录包含 parts.csv,逐文件记录来源、快照、文档数与大小

主要列字段

  • text: 文档文本
  • url: 源 URL
  • host: 域名
  • lang: ISO 639-3 语言代码(越南语为 vie
  • lang_score: 越南语音节占比(0-1)
  • n_syllables: 音节数
  • diacritics: 声调符号状态(present / absent / mixed)
  • dup_cluster: 文本去重哈希
  • is_representative: 是否为重复组中的首个文档
  • license_class: 许可证分类

数据用途

  1. 预训练 / 继续预训练: 用于越南语语言模型训练,可按音节数预算筛选
  2. 领域语料构建: 按 host 分组提取法律、金融、医疗等特定领域文本
  3. 训练越南语分词器: 跨来源采样代表性文本
  4. 跨语料去重分析: 通过 dup_cluster 识别不同来源间的重复内容
  5. 声调符号恢复与语言识别: 利用 diacriticslang_score 列训练相关模型

使用方式

  • DuckDB: 支持远程直接查询 Parquet 文件(通过 hf:// 路径),无需下载
  • Python: 支持流式加载(load_dataset 配合 streaming=True),或按来源下载到本地
  • 建议优先流式读取,整个数据集(10.6 GB)不适合普通磁盘一次性存放
搜集汇总
数据集介绍
vitco-clean 数据集图片
构建方式
ViTco Clean数据集是在原始ViTco语料库基础上经过严格清洗流程构建而成的越南语文本集合。构建过程依次执行文本标准化、质量度量与过滤、基于规范化文本的去重以及个人标识符遮蔽四步操作。标准化确保后续比较的一致性,度量与过滤剔除非越南语散文及过短文档,去重消除来自不同来源的重复内容,最后遮蔽个人敏感信息。该流程对来自HPLT v3和FinePDFs两个公共语料库的2,635,860篇文档进行处理,最终保留1,337,452篇,整体保留率为50.7%。
特点
该数据集具有多维度特征:包含2,279,914篇越南语文档,总大小10.6 GB,以Parquet格式存储,支持高效列式读取。每个文档均附带丰富的元数据,如语言分数、音节数、声调符号状态、来源域名及去重簇标识等,便于用户按需过滤和进一步分析。数据集按来源分为hplt3和finepdfs两个配置,可独立或合并使用。值得注意的是,质量分类器模型尚未训练,因此相关列暂为0.0,但文本本身已确保为越南语散文。
使用方法
该数据集可通过多种方式灵活使用。Python用户可使用datasets库流式加载单个配置或全部数据,也可使用huggingface_hub下载特定子集至本地。DuckDB支持直接对远程Parquet文件执行SQL查询,便于快速统计、过滤和聚合分析。典型应用包括预训练语言模型、领域专属语料构建(如法律、金融)、越南语分词器训练、声调恢复任务等。用户可按需基于lang_score、n_syllables等列进行过滤,或按dup_cluster执行跨源去重。建议优先流式读取,因整个数据集规模较大。
背景与挑战
背景概述
ViTco Clean数据集由tamnd等人于2023年创建,旨在为越南语自然语言处理提供经过清洗的高质量语料库。该数据集整合了HPLT v3和FinePDFs两大公开语料,通过标准化、过滤、去重及隐私保护等流程,最终生成包含超过227万篇越南语文档的10.6GB数据集合。该数据集的出现填补了越南语预训练语料库的空白,为越南语语言模型的训练、领域特定语料构建以及越南语分词器开发等研究提供了坚实基础,推动了越南语NLP领域的发展。
当前挑战
该数据集面临的挑战涵盖多个层面:在领域问题层面,越南语文本存在大量网络噪声,包括非越南语内容、重复段落、样板文本及过短文档,需设计有效过滤机制;同时,音调和标点符号的规范化处理对后续去重和语言识别至关重要。在构建层面,多来源语料(如网页和PDF)的整合面临格式不统一、质量参差不齐的问题,且去重需跨不同快照进行,确保全局唯一性;此外,个人标识符的隐私保护需在不影响文本可用性的前提下实现,平衡数据开放与隐私安全;最后,语料规模庞大(10.6GB),如何在保持流式处理效率的同时,提供便捷的访问接口和可扩展的架构,也是构建中的关键挑战。
常用场景
经典使用场景
ViTco Clean数据集作为大规模越南语清洗语料库,其经典使用场景聚焦于预训练语言模型的基础文本供给。该语料库整合了来自HPLT v3网络文本与FinePDFs文档解析文本的逾227万篇越南语文档,经规范化、质量筛选、去重及隐私遮蔽等严谨清洗流程,为越南语自然语言处理研究提供了纯净、可复现的语料基础。研究者常以其为基石,开展从零预训练或继续预训练越南语Transformer模型,亦或利用其细粒度元数据(如音节数、语言得分、变音符号状态)构建定制化子集,以满足特定领域任务的需求。
解决学术问题
该数据集精准回应了低资源语言语料匮乏与质量参差的学术难题。通过系统化的清洗管线,解决了多源语料中普遍存在的文本冗余、非越南语内容污染、格式杂乱及个人隐私信息泄露等问题,显著提升了语料的纯净度与可用性。其保留的完整溯源列(如来源、快照、URL)和可重滤波的度量指标(如lang_score、n_syllables),使研究者能够在不重读原始文本的前提下,灵活调整语料过滤阈值,为跨语料库对比、去重策略评估及语料质量影响分析等学术探究提供了标准化的实验基准,推动了越南语NLP领域的可重复性研究。
衍生相关工作
ViTco Clean的发布催生了一系列衍生研究工作。其一,基于其去重簇(dup_cluster)信息,研究者开展了跨语料库重复内容检测的深入分析,探讨了不同网络爬虫衍生语料间的重叠度及其对模型训练偏差的影响。其二,利用其质量度量列(lang_score, diacritics),衍生出针对越南语文本质量评估的新方法,并构建了更精细的语料分级体系。其三,该数据集的清洗流程设计理念被后续研究者借鉴,应用于其他低资源语言的语料库构建中,形成了可迁移的数据清洗范式。此外,依托其大规模纯净文本,学界还产出了多个越南语预训练模型(如PhoBERT的持续训练版本),并推动了越南语文本生成、摘要及情感分析等下游任务基准的更新迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务