遇见数据集

vietnamese-source-text

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

Vietnamese Source Text 是一个越南语原始文本数据集,由公开的越南语语料库组成,每个来源在统一合约和模式下组织,未经任何预处理或清洗。数据集以 Parquet 格式存储,按快照和输入文件分区,每个文档包含文本及其元数据(如许可证类别和同意声明)。仅包含允许重新分发的文档,许可证类别有 open 和 permissive-attribution 两种,用户可通过 license_class 列进行过滤。数据集适用于文本生成(text-generation)和掩码填充(fill-mask)等自然语言处理任务,可用于训练越南语语言模型或进行文本分析。由于尚未密封快照,当前无固定样本计数,但数据持续更新。

The Vietnamese Source Text dataset is a Vietnamese raw text dataset composed of publicly available Vietnamese corpora, organized under a unified contract and schema for each source, without any preprocessing or cleaning. The dataset is stored in Parquet format, partitioned by snapshot and input file, with each document containing text and its metadata (such as license category and consent statement). It only includes documents that allow redistribution, with license categories open and permissive-attribution, allowing users to filter via the license_class column. The dataset is suitable for natural language processing tasks such as text generation and fill-mask, and can be used to train Vietnamese language models or perform text analysis. Since the snapshots are not yet sealed, there is currently no fixed sample count, but the data is continuously updated.

创建时间:
2026-08-18
原始信息汇总

越南语源文本数据集(Vietnamese Source Text)

数据集概览

  • 名称:Vietnamese Source Text
  • 语言:越南语(vi)
  • 许可证:自定义许可证(per-document-open-permissive-attribution),详情见许可证链接
  • 任务类别:文本生成(text-generation)、掩码填充(fill-mask)
  • 标签:越南语(vietnamese)

数据集内容

该数据集以 Parquet 格式存储,包含越南语公开语料库的原始文本。数据按快照(snapshot)和输入文件进行分区存放。每个文档都带有 license_class 列标注其许可证类别(如 open 或 permissive-attribution),以及 consent 列记录页面授权状态。

数据筛选与授权

  • 仓库仅包含允许重新分发文本的文档,对于保留文本及数据挖掘权利的页面,无论其许可证如何,均不会被纳入。
  • 许可证类别支持 open 和 permissive-attribution 两类,用户可通过 license_class 列筛选所需的数据范围。
  • consent 列记录每个页面的授权情况,空值表示该文档来自其他语料库且无相关授权信息。

数据使用说明

当前仓库尚未密封任何快照,因此尚无正式的数据统计或签名清单。数据文件可能随源重新固定而被重写,当前文件列表仅为最近一次运行的结果。用户可通过 SQL 查询方式直接读取 Parquet 文件,无需下载整个仓库。

数据来源与生成

该数据集由 GitHub 上的 gao 项目 构建,所有文档均需通过统一的摄取合同。数据集卡片由 gao kho card 命令从快照清单自动生成。

搜集汇总
数据集介绍
vietnamese-source-text 数据集图片
构建方式
该数据集汇聚了来自四个公开语料库的逾1.16亿篇越南语文档,总容量达257.6GB,统一于单一Parquet格式与模式之下。其构建流程以gao管道为核心,每篇文档均经规范化处理,采用NFC标准及音节切分,并赋予唯一标识符。数据按来源划分为hplt3、fineweb2、glotcc及finepdfs四个子集,每个子集对应独立的配置名,确保来源可追溯且便于按需加载。值得注意的是,该数据集为原始语料快照,未进行去重或质量过滤,旨在为用户提供最本真的数据视图。
特点
该数据集最显著的特点是高度结构化的元数据体系,共包含42个字段,覆盖文档身份、来源追踪、抓取状态、语言识别、质量评分、重复聚类、隐私脱敏及许可分类等维度。其中,doc_id基于文本内容哈希,确保文本级去重可复现;license_class依据逐文档重新分发判定,赋予使用者灵活筛选空间;而pii_spans在脱敏等级0与1下保留位置信息,兼顾隐私与可分析性。此外,方言特征、翻译状态及教育价值评分等细粒度标注,为多维度语料筛选提供了有力支撑。
使用方法
使用者可通过Hugging Face datasets库按配置名直接加载数据,例如load_dataset('open-index/vietnamese-raw-text', 'finepdfs', split='train'),并支持流式读取。也可借助DuckDB的httpfs插件直接从远程查询Parquet文件,无需本地下载;parts.csv提供轻量级文件清单,便于快速统计。文档文本列体积较大,建议在查询时指定具体字段或单个文件,以减少传输开销。该数据集适用于大语言模型预训练、masked language modeling及语料分析等任务,研究者可依据license_class等列定制子集,满足不同的合规与质量要求。
背景与挑战
背景概述
越南语作为东南亚地区的重要语言,其自然语言处理研究长期受制于高质量语料资源的匮乏。为应对这一瓶颈,open-index团队于近期构建了vietnamese-source-text数据集,汇聚自hplt3、fineweb2、glotcc及finepdfs四大公开语料库,共计逾1.16亿篇文档,体量达257.6GB,并以统一的Parquet格式存储,确保模式一致性。该数据集旨在为越南语预训练语言模型提供坚实的数据基础,支持文本生成与掩码填充等核心任务,其发布填补了越南语大规模开源语料的空白,对推动低资源语言NLP研究具有里程碑意义。
当前挑战
构建该数据集面临多重挑战:领域层面,越南语存在独特的声调标记与方言变体,且网络文本中混合大量无标音文字及机器翻译内容,需精准识别与处理,以保障语料质量。构建过程中,需整合四个来源各异、格式不一的公共语料,统一为单一模式,并处理版权与数据使用许可的合规性,仅纳入可再分发文档。此外,数据规模庞大,存储与索引效率成为关键,团队采用分块写入与列式存储优化,但因持续更新,数据完整性需依赖快照机制,无法提供永久固定版本,这对依赖稳定语料的研究者构成使用障碍。
常用场景
经典使用场景
在自然语言处理领域,大规模、高质量的单语语料库是预训练语言模型的基础。该数据集汇聚了来自四个公开语料库的逾1.16亿篇越南语文档,总计257.6GB,统一为42列的Parquet格式,为越南语文本生成、掩码语言建模等自监督学习任务提供了海量且结构化的训练素材。研究者可直接利用HuggingFace datasets库加载特定子集(如hplt3、fineweb2),进行模型预训练或微调,从而推动越南语自然语言处理技术的进步。
解决学术问题
该数据集有效缓解了越南语自然语言处理研究中语料稀缺且分散的困境。通过整合多源异构数据并统一schema,解决了跨语料库数据格式不一致、可比性差的问题,使研究者能够基于一致的数据接口进行模型训练与评估。同时,数据中记录的文档级质量、许可、重复度、PII等丰富元数据,支持了数据筛选、去重、隐私保护等关键学术议题的探究,为构建透明、可复现的越南语研究基准奠定了坚实基础。
衍生相关工作
该数据集的衍生价值体现在其支持构建多样化的越南语评测基准和专用数据集。研究者可依据文档中的质量评分、教育价值标签、文本结构分类(如法律文档、论文、论坛帖)等元数据,抽取特定领域的子集,用于开发领域自适应模型或评价模型在不同语体上的表现。其与gao流水线的其他组件(如去重、质量过滤后的release版本)协同使用,能够催生一系列关于数据配比、课程学习、隐私保护对越南语模型性能影响的实证研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务