遇见数据集

vitweb

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

ViTweb是一个仅包含元数据的越南语网页语料库,由gao爬虫从越南语网站(如省级新闻、论坛和政府发布)抓取而成,旨在补充Common Crawl未覆盖的内容。数据集包含10,303个文档,总大小2.7 MB,以Parquet格式存储,包含42个字段,包括URL、主机、抓取时间、robots决策、媒体类型、语言标识(ISO 639-3编码,越南语为vie)、语言分数、音节数、重复检测簇、PII信息、许可证分类等。文本内容被保留在爬虫服务器上,不包含在数据集中,因此用户需自行根据URL合法获取文本。该数据集适用于构建抓取列表(基于已知存在的、robots.txt允许的、有足够长度的越南语页面)、评估网站抓取价值(按主机统计页面数量和平均音节数)、以及测量爬虫性能(如按天统计保留页面数)。

ViTweb is a Vietnamese web corpus containing only metadata, crawled by the gao crawler from Vietnamese websites (e.g., provincial news, forums, and government releases) to supplement content not covered by Common Crawl. The dataset contains 10,303 documents, total size 2.7 MB, stored in Parquet format with 42 fields including URL, host, crawl time, robots decision, media type, language identification (ISO 639-3 code, Vietnamese as vie), language score, syllable count, duplicate detection cluster, PII information, license classification, etc. The text content is retained on the crawler server and is not included in the dataset; users must legally obtain the text via URLs. The dataset is suitable for building crawl lists (based on known existing, robots.txt-allowed, sufficiently long Vietnamese pages), evaluating website crawl value (by counting pages and average syllable count per host), and measuring crawler performance (e.g., counting retained pages per day).

创建时间:
2026-08-19
原始信息汇总

ViTweb 数据集概述

基本信息

  • 语言: 越南语(单语)
  • 规模: 10K-100K 文档(共 10,303 条记录)
  • 许可证: 逐文档受限(per-document-restricted),详见 https://github.com/tamnd/gao/blob/main/law/posture.go
  • 数据格式: Parquet(2.7 MB,28 个文件分片)
  • 标注情况: 无人工标注(no-annotation)
  • 来源: 原创爬取数据(非已有数据集整合)
  • 标签: 越南语、预训练、网络爬虫、语料库、仅元数据

数据集内容

本数据集为越南语网页爬虫的元数据集合,每行对应一个被爬取并保留的页面,包含:

  • 页面地址(URL)及主机名(host)
  • 抓取时间(fetched_at)
  • robots.txt 决策(robots_decision、robots_rule、robots_hash)
  • 媒体类型(media_type)
  • 页面质量评估的完整测量数据(含 heuristics 映射)

关键设计: 数据集仅包含元数据,不包含文本内容。原因是爬取的网页不授予重新分发权限,因此仅发布地址和测量数据,用户可根据 URL 自行合法获取文本。

数据布局

README.md parts.csv data/web/ web-20260819-00000-00000.parquet ... 共 28 个文件

  • 每个来源一个目录,文件名包含快照版本、输入文件和分片号
  • 目录命名采用非 Hive 风格,保持简洁
  • 数据包含多个修订版本(web-20260819、web-20260820、web-20260820b),需按文件名前缀筛选特定版本

数据列(42 列)

核心列包括:

  • 身份列: doc_id(文本哈希)、raw_id(原始字节哈希)
  • 来源列: sourcesource_locatorurlhosturl_template
  • 抓取信息: fetched_atmedia_typehttp_statusrobots_decisionrobots_rulerobots_hash
  • 质量评估: lang(ISO 639-3,越南语为 "vie")、lang_scorediacritics(声调符号状态)、translated(是否为翻译文本)、gao_qual(质量评分)、gao_edu(教育价值评分)、heuristics(原始启发式测量数据)
  • 文本统计: n_charsn_syllablesn_tokens
  • 内容结构: structure(文章/论坛/法律等)、register
  • 去重相关: dup_clusterdup_cluster_sizeis_representative
  • 隐私处理: pii_levelpii_typespii_spans
  • 许可判定: license_classlicense_evidence
  • 其他: contam_flags(评估基准重叠标记)、upstream_fields(来源语料原始元数据)、tdm_signals(文本数据挖掘信号)、consent(页面留存同意信息)

注意:text 列存在于 schema 中但所有行为 NULL(设计如此)。

使用方式

  • DuckDB: 可直接通过 hf://datasets/open-index/vitweb/ 读取 Parquet 文件,无需下载整个数据集
  • Python: 支持 datasets 库流式加载(load_dataset("open-index/vitweb", "web", streaming=True)),也支持 snapshot_download 选择性下载单源数据

潜在应用场景

  1. 构建可执行的抓取列表: 筛选通过所有质量门槛、允许 robots.txt 抓取的越南语页面 URL
  2. 识别值得爬取的越南语网站: 按主机统计页面数量和质量指标,发现地方新闻网站等 Common Crawl 未覆盖的站点
  3. 测量爬虫效果: 结合 open-index/vitweb-rejects 数据集分析抓取请求的完整结果

相关链接

  • 详细 schema 说明: https://github.com/tamnd/gao/blob/main/SCHEMA.md
  • 数据清单及修订版本: https://github.com/tamnd/gao/blob/main/harvest/manifest.json
搜集汇总
数据集介绍
vitweb 数据集图片
构建方式
ViTweb数据集是由gao爬虫自主抓取并精心筛选的越南语网页元数据集合,涵盖10,303篇文档,仅包含元数据而不含正文文本。该数据集通过记录每个被抓取页面的URL、主机、抓取时间、robots.txt允许规则及各项质量评估指标,构建了一个可复现的语料库索引。每一条记录都包含完整的heuristics映射,使得用户能够依据URL和评分自行合法获取文本,从而重建语料库。数据集以Parquet格式存储,按源目录划分,并为每个文件提供parts.csv清单,便于快速浏览与统计。
特点
该数据集的核心特点在于其元数据导向的设计,避免了文本再分发的法律风险,同时提供详尽的字段信息,如语言识别分数、音调符号存在性、文本长度等42个字段,支持细粒度的语料筛选。其独特性在于聚焦越南省级新闻、论坛和政府网站,补足了Common Crawl覆盖不足的领域。此外,数据集包含未保留页面的拒绝记录,增强了透明度,且允许通过URL和评分进行语料重建,兼顾了合法性与实用性。
使用方法
用户可通过Hugging Face的datasets库以流式模式加载数据,或使用DuckDB直接查询Parquet文件,实现高效的数据筛选。数据集支持基于源、主机、语言、质量分数等条件的组合查询,便于构建定制化的抓取列表或评估爬虫产量。使用时需注意,文本字段为空,用户需根据URL自行获取内容,并遵守robots.txt规则及版权限制。流式读取是推荐方式,以避免大规模数据下载,同时可按需下载特定源或文件进行本地分析。
背景与挑战
背景概述
ViTweb数据集由gao项目团队于2026年创建,旨在弥补现有越南语网络语料库的不足。现有语料库如fineweb-2、GlotCC和HPLT均基于Common Crawl构建,对越南省级新闻、论坛和政府网站覆盖不足。该数据集由gao爬虫自主抓取,包含10,303篇越南语文档的元数据,如URL、主机、抓取时间、robots决策及质量评估指标,但不含文本内容。其设计旨在提供可验证的抓取列表和质量度量,支持研究者依法自行获取文本,重建语料库。该数据集对越南语自然语言处理领域具有潜在影响力,为低资源语言的语料库构建提供了新范式。
当前挑战
ViTweb数据集面临多项挑战。领域层面,越南语网络文本分布不均,现有基于Common Crawl的语料库对省级新闻和论坛覆盖不足,导致语言模型训练数据偏差。构建过程中,需处理robots.txt合规、版权限制和文本再分发许可问题,因此数据集仅发布元数据而保留文本,确保合法使用。此外,爬虫需应对动态网页、反爬机制及数据质量评估(如语言识别、重复检测)的复杂性。数据集的持续更新和版本管理也构成挑战,需在保持稳定性的同时整合新数据。
常用场景
经典使用场景
ViTweb数据集作为越南语网络文本资源的精选索引,其核心用途在于为学术研究者提供一个高价值、可合法获取的网页语料清单。它记录了从越南省级新闻、论坛及政府出版物中抓取的10,303个文档的元数据,包括URL、主机、抓取时间及机器人协议许可等关键信息。研究者可依据这些元数据,通过自主合规访问重建语料,从而开展针对越南语特定领域的大规模语言模型预训练、领域适应性微调,以及低资源语言处理技术的探索。该数据集的流式加载与列式存储设计,也极大便利了远程数据扫描与高效筛选。
解决学术问题
该数据集直面越南语网络文本资源稀缺且分布不均的学术难题,尤其针对Common Crawl等通用爬虫难以覆盖的省级新闻网站和官方发布平台。通过提供精细的文档级元数据与质量评估指标(如语言置信度、音节数、变音符号存在性),它使研究者能够量化评估特定站点的内容产出价值,并构建针对性的爬取与语料筛选策略。此举填补了越南语中领域特定预训练语料的空白,为改善语言模型在地方性、实时性内容上的表现提供了数据基础,同时也为网络爬虫的效率优化与合规性研究提出了新范式。
衍生相关工作
ViTweb数据集的设计理念与配套工具链催生了若干衍生工作方向。其‘元数据公开,文本自取’的模式启发了构建可验证、可复现的网络语料库的新思路,推动了爬虫决策透明度与可审计性的研究。数据集中的质量评估列(如gao_qual、heuristics),为开发更精细的越南语文本质量分类器提供了基准,促进了自动清洗与过滤算法的发展。同时,其与拒绝列表(vitweb-rejects)的联合分析,支持了爬虫策略优化与抓取效率建模的研究,而文档级别的重复检测与PII标注框架,也为多语料融合与隐私保护技术提供了参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务