vitco
收藏资源简介:
ViTco是一个大规模越南语文本数据集,汇集了来自四个公开语料库(HPLT v3、fineweb-2、GlotCC v1、FinePDFs)的165,847,195个文档,总大小370.2 GB,以Parquet格式存储,并统一了schema。该数据集保留原始来源信息,未进行质量过滤或去重,提供了lang_score、n_syllables、diacritics等字段,支持用户自定义过滤和清洗。数据集适用于多种自然语言处理任务,包括预训练、继续预训练、领域特定语料构建、分词器训练、文档去重与重叠研究、以及音调恢复和语言识别。每个文档包含url、host、license_class、lang_score、n_syllables、diacritics等字段,以及原始来源的完整元数据。数据集通过Hugging Face Datasets加载,支持流式读取和本地下载。
ViTco is a large-scale Vietnamese text dataset, aggregating 165,847,195 documents from four public corpora (HPLT v3, fineweb-2, GlotCC v1, FinePDFs) with a total size of 370.2 GB, stored in Parquet format with a unified schema. The dataset retains original source information without quality filtering or deduplication, providing fields such as lang_score, n_syllables, diacritics, etc., supporting user-defined filtering and cleaning. It is suitable for various natural language processing tasks, including pre-training, continued pre-training, domain-specific corpus construction, tokenizer training, document deduplication and overlap research, as well as tone restoration and language identification. Each document contains fields such as url, host, license_class, lang_score, n_syllables, diacritics, and complete metadata from the original source. The dataset can be loaded via Hugging Face Datasets, supporting streaming reading and local download.
ViTco 数据集概述
基本信息
- 名称: ViTco
- 语言: 越南语(单语)
- 许可证: 自定义许可(per-document-open-permissive-attribution)
- 规模: 超过1亿条文档(100M<n<1B)
- 任务类型: 文本生成、掩码填充
- 数据格式: Parquet
数据集规模
| 来源 | 文档数 | 文件数 | 大小 |
|---|---|---|---|
| hplt3 | 120,230,406 | 444 | 210.3 GB |
| fineweb2 | 31,165,817 | 174 | 79.0 GB |
| glotcc | 13,232,715 | 113 | 53.9 GB |
| finepdfs | 1,218,257 | 54 | 26.9 GB |
| 总计 | 165,847,195 | 785 | 370.2 GB |
数据来源
该数据集整合了4个公开越南语语料库,均固定于特定版本:
- HPLT v3(hplt3): 最大来源,源自互联网档案馆和Common Crawl,未托管在Hugging Face上
- fineweb-2(fineweb2): Common Crawl经FineWeb流程处理,是Hugging Face上最大的越南语语料库
- GlotCC v1(glotcc): 基于Common Crawl,由慕尼黑大学CIS构建,侧重语言覆盖
- FinePDFs(finepdfs): 从PDF提取的文本,包含政府通告、法律文本等正式语料
数据特点
- 统一架构: 所有来源的文档均转换为相同模式,每行包含URL、域名、许可证类别及来源定位信息
- 未清洗: 未进行质量过滤或去重,保留了
lang_score、n_syllables、diacritics等列供使用者自行处理 - 可追溯: 每个文档保留原始来源信息,支持按需选择单个或多个语料库
配置选项
- default: 全部数据(data//.parquet)
- hplt3: 仅HPLT v3数据
- fineweb2: 仅fineweb-2数据
- glotcc: 仅GlotCC数据
- finepdfs: 仅FinePDFs数据
主要应用场景
- 预训练与继续预训练: 可基于
lang_score、n_syllables、diacritics等列进行过滤 - 领域专用语料构建: 通过
host列按域名筛选特定领域语料(如法律、金融、医疗) - 越南语分词器训练: 跨来源采样代表性文本
- 去重与重叠研究: 因未去重,适合研究不同语料库间的重叠情况
- 声调恢复与语言识别:
diacritics列标注了文档的声调状态(完整/缺失/混合)
访问方式
- DuckDB: 支持远程直接读取Parquet文件
- Python: 通过
datasets库流式加载或huggingface_hub下载特定部分 - 数据集为公开访问,无需token




