遇见数据集

vitco

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

ViTco是一个大规模越南语文本数据集,汇集了来自四个公开语料库(HPLT v3、fineweb-2、GlotCC v1、FinePDFs)的165,847,195个文档,总大小370.2 GB,以Parquet格式存储,并统一了schema。该数据集保留原始来源信息,未进行质量过滤或去重,提供了lang_score、n_syllables、diacritics等字段,支持用户自定义过滤和清洗。数据集适用于多种自然语言处理任务,包括预训练、继续预训练、领域特定语料构建、分词器训练、文档去重与重叠研究、以及音调恢复和语言识别。每个文档包含url、host、license_class、lang_score、n_syllables、diacritics等字段,以及原始来源的完整元数据。数据集通过Hugging Face Datasets加载,支持流式读取和本地下载。

ViTco is a large-scale Vietnamese text dataset, aggregating 165,847,195 documents from four public corpora (HPLT v3, fineweb-2, GlotCC v1, FinePDFs) with a total size of 370.2 GB, stored in Parquet format with a unified schema. The dataset retains original source information without quality filtering or deduplication, providing fields such as lang_score, n_syllables, diacritics, etc., supporting user-defined filtering and cleaning. It is suitable for various natural language processing tasks, including pre-training, continued pre-training, domain-specific corpus construction, tokenizer training, document deduplication and overlap research, as well as tone restoration and language identification. Each document contains fields such as url, host, license_class, lang_score, n_syllables, diacritics, and complete metadata from the original source. The dataset can be loaded via Hugging Face Datasets, supporting streaming reading and local download.

创建时间:
2026-08-18
原始信息汇总

ViTco 数据集概述

基本信息

  • 名称: ViTco
  • 语言: 越南语(单语)
  • 许可证: 自定义许可(per-document-open-permissive-attribution)
  • 规模: 超过1亿条文档(100M<n<1B)
  • 任务类型: 文本生成、掩码填充
  • 数据格式: Parquet

数据集规模

来源 文档数 文件数 大小
hplt3 120,230,406 444 210.3 GB
fineweb2 31,165,817 174 79.0 GB
glotcc 13,232,715 113 53.9 GB
finepdfs 1,218,257 54 26.9 GB
总计 165,847,195 785 370.2 GB

数据来源

该数据集整合了4个公开越南语语料库,均固定于特定版本:

  1. HPLT v3(hplt3): 最大来源,源自互联网档案馆和Common Crawl,未托管在Hugging Face上
  2. fineweb-2(fineweb2): Common Crawl经FineWeb流程处理,是Hugging Face上最大的越南语语料库
  3. GlotCC v1(glotcc): 基于Common Crawl,由慕尼黑大学CIS构建,侧重语言覆盖
  4. FinePDFs(finepdfs): 从PDF提取的文本,包含政府通告、法律文本等正式语料

数据特点

  • 统一架构: 所有来源的文档均转换为相同模式,每行包含URL、域名、许可证类别及来源定位信息
  • 未清洗: 未进行质量过滤或去重,保留了lang_scoren_syllablesdiacritics等列供使用者自行处理
  • 可追溯: 每个文档保留原始来源信息,支持按需选择单个或多个语料库

配置选项

  • default: 全部数据(data//.parquet)
  • hplt3: 仅HPLT v3数据
  • fineweb2: 仅fineweb-2数据
  • glotcc: 仅GlotCC数据
  • finepdfs: 仅FinePDFs数据

主要应用场景

  1. 预训练与继续预训练: 可基于lang_scoren_syllablesdiacritics等列进行过滤
  2. 领域专用语料构建: 通过host列按域名筛选特定领域语料(如法律、金融、医疗)
  3. 越南语分词器训练: 跨来源采样代表性文本
  4. 去重与重叠研究: 因未去重,适合研究不同语料库间的重叠情况
  5. 声调恢复与语言识别: diacritics列标注了文档的声调状态(完整/缺失/混合)

访问方式

  • DuckDB: 支持远程直接读取Parquet文件
  • Python: 通过datasets库流式加载或huggingface_hub下载特定部分
  • 数据集为公开访问,无需token
搜集汇总
数据集介绍
vitco 数据集图片
构建方式
ViTco数据集是在越南语公共文本资源分散、格式不一的背景下构建的。它将来自HPLT v3、fineweb-2、GlotCC和FinePDFs这四个公开语料库的文档统一整合为单一Parquet格式,采用一致的Schema,每个文档包含url、host、license_class等元数据,并保留各来源的原始字段映射。数据集构建过程未进行质量过滤和去重,而是通过lang_score、n_syllables、diacritics等列提供清洗依据。各源数据按目录划分,文件名包含快照信息,便于追溯和更新。
特点
ViTco数据集具有规模庞大、来源多样和高度透明的特点。它包含超过1.65亿篇越南语文档,总计370.2GB,远超现有最大的越南语语料库。数据集融合了网页文本、PDF提取文本等不同类型,涵盖正式与非正式语域。其独特之处在于保留完整来源信息和未经过滤的原始状态,为研究者提供了自定义清洗和去重的可能性。此外,数据集采用列式存储和统一Schema,支持高效的查询和分析。
使用方法
ViTco数据集可通过HuggingFace datasets库或DuckDB直接访问。用户可以选择加载全部数据(default配置)或特定来源(如hplt3、fineweb2等配置)。推荐使用流式加载以节省本地存储空间,并可通过parts.csv文件快速获取各部分统计信息。数据集的列设计支持按语言分数、音节数、来源域名等进行过滤和采样,适用于预训练、领域语料构建、分词器训练和去重研究等多种场景。
背景与挑战
背景概述
ViTco数据集由越南语自然语言处理社区于近期构建,整合了HPLT v3、fineweb-2、GlotCC和FinePDFs四大公共语料库,形成包含165,847,195篇越南语文档、总规模达370.2GB的统一Parquet格式语料。该数据集由open-index团队维护,旨在解决越南语文本资源分散、格式异构的困境,为大规模预训练、领域适配及语言技术研究提供标准化数据基础。其统一schema设计保留了来源可溯性,显著提升了越南语语料的可用性,对低资源语言处理领域具有重要推动作用。
当前挑战
ViTco数据集面临多重挑战:首先,源语料库在文档定义、字段命名及结构上存在根本性差异,统一schema设计需兼顾异构性;其次,数据规模庞大,存储和处理效率要求高,Parquet格式虽高效但大文件读取仍需优化;再者,语料中存在大量重复文档,去重策略需谨慎权衡,以便支持重复检测研究;此外,版权归属与许可证类别标注复杂,需确保合规性;最后,语料质量参差不齐,需设计语言评分、音节数等过滤机制,以适配不同下游任务的需求。
常用场景
经典使用场景
ViTco数据集作为越南语自然语言处理领域的综合性语料库,其经典使用场景在于为大规模语言模型的预训练与持续预训练提供数据基础。该数据集整合了来自HPLT v3、fineweb-2、GlotCC和FinePDFs四个公开语料库的逾1.65亿篇越南语文档,统一了数据模式,并保留了来源、URL、语言评分、音节数、声调符号等关键元数据,使得研究者能够基于统一接口进行高效的数据筛选与采样,从而构建适应特定需求的训练语料。
解决学术问题
该数据集有效解决了越南语语料分散、格式异构且获取不便的学术研究难题。此前,越南语公开文本分散于多个平台,且各语料库在文档定义、字段命名及数据格式上存在显著差异,给大规模预训练研究带来了极大的数据整合成本。ViTco通过统一的模式整合了四大语料库,并保留了lang_score、n_syllables、diacritics等质量与语言特征字段,为语言模型训练中的语料筛选、去重策略选择及领域适配等关键问题提供了数据基础,有力促进了越南语自然语言处理研究的可复现性与规模化发展。
衍生相关工作
ViTco数据集的构建模式与内容直接关联并推动了若干领域的相关工作。其整合多源语料的范式启发了针对低资源语言的数据集统一与标准化研究。在去重研究方面,该数据集提供了保留原始状态的多源越南语文本,为近似重复检测算法的评估与改进提供了基准。在语言模型预训练领域,ViTco为越南语大语言模型的训练提供了数据规模与多样性上的支持,其元数据字段设计也促进了数据筛选方法的研究,例如基于音节数和语言质量评分的语料过滤策略。此外,该数据集对声调符号状态的标注,为越南语声调恢复等特定任务的研究提供了新的数据资源,催生了相关模型的训练与优化工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务