遇见数据集

vitweb-rejects

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

ViTweb Rejects 是一个仅包含元数据的越南语数据集,记录了爬虫在抓取过程中拒绝的页面。该数据集包含来自公共网络语料库的146,936个文档,以Parquet格式存储,总大小22.1 MB。每条记录对应一个被拒绝的页面,并包含拒绝阶段(如crawl.fetch、crawl.sift等)、拒绝原因(如robots、fetch、boilerplate、language、short、repetition等)以及用于判断的测量指标(如重复率、音节数等)。数据集没有文本内容,仅包含元数据,包括42个标准列(如doc_id、url、host、lang、n_syllables等)和额外的3个拒绝相关列(reject_stage、reject_reason、reject_detail)。该数据集可用于分析爬虫的拒绝模式、重新调整过滤阈值、检查机器人记录、比较不同语料库的覆盖范围等。数据由开源项目gao生成,基于多个公共语料库(如CulturaX、mC4、OSCAR等)但仅包含被拒绝的页面。

ViTweb Rejects is a metadata-only Vietnamese dataset that records pages rejected by the crawler during the crawling process. The dataset contains 146,936 documents from public web corpora, stored in Parquet format with a total size of 22.1 MB. Each record corresponds to a rejected page and includes the rejection stage (e.g., crawl.fetch, crawl.sift), rejection reason (e.g., robots, fetch, boilerplate, language, short, repetition), and measurement metrics used for judgment (e.g., repetition rate, number of syllables). The dataset has no text content, only metadata, including 42 standard columns (e.g., doc_id, url, host, lang, n_syllables) and 3 additional rejection-related columns (reject_stage, reject_reason, reject_detail). It can be used to analyze crawler rejection patterns, readjust filtering thresholds, check robot records, compare coverage across different corpora, etc. The data is generated by the open-source project gao, based on multiple public corpora (e.g., CulturaX, mC4, OSCAR) but only contains rejected pages.

创建时间:
2026-08-19
原始信息汇总

ViTweb Rejects 数据集详情

数据集简介

ViTweb Rejects 是一个仅包含元数据的越南语数据集,记录了 gao 爬虫在抓取过程中拒绝的网页信息。数据集包含 146,936 个越南语文档,以 Parquet 格式存储,总大小为 22.1 MB,共 28 个文件部分。

数据内容

每个数据行代表一个被爬虫拒绝的页面,包含以下关键信息:

  • 拒绝阶段:记录页面在爬取的哪个环节被拒绝(如抓取、提取、筛选等阶段)
  • 拒绝原因:以单词形式记录的原因(如 robots、fetch、boilerplate、language、short、repetition 等)
  • 拒绝详情:包含具体数值的详细拒绝原因描述
  • 测量指标:页面被判断时依据的各种测量数据

数据来源

数据来源于公开语料库(web 来源),固定于 web-20260819web-20260820web-20260820b 三个修订版本。同时,数据集的清单文件(parts.csv)提供了每个文件部分的来源、快照、输入文件、文档数量和大小信息。

数据结构

存储布局

README.md parts.csv data/web/ web-20260819-00000-00000.parquet ... 共28个文件

列信息

数据集包含 42 列,主要类别包括:

  • 身份标识doc_idraw_id(blake3 哈希值)
  • 文本信息text(标准化文本)、n_chars(字符数)、n_syllables(越南语音节数)、n_tokens(token数)
  • 来源信息sourcesource_locatorurlhosturl_templatefetched_at
  • 抓取信息http_statusrobots_decisionrobots_rulerobots_hashtdm_signalsconsent
  • 筛选信息lang(ISO 639-3 语言代码)、lang_scorediacriticstranslatedgao_qualgao_eduheuristics
  • 内容属性license_classlicense_evidencestructureregister
  • 去重信息dup_clusterdup_cluster_sizeis_representative
  • 隐私信息pii_levelpii_typespii_spans
  • 拒绝相关reject_stagereject_reasonreject_detail
  • 其他schema_versionpipeline_versioncontam_flagsupstream_fieldsmedia_typeextractor

应用场景

  1. 分析爬虫请求分布:通过拒绝阶段和原因,了解爬虫在哪些环节丢失了页面
  2. 重新过滤数据:基于拒绝时记录的测量数据,可在不重新爬取的情况下调整过滤阈值
  3. 检查robots协议记录:区分哪些网站未被提供、哪些网站明确拒绝访问

使用方式

DuckDB 查询

支持通过 DuckDB 远程直接查询 Parquet 文件,无需下载整个数据集。

Python 加载

支持 datasets 库流式加载和 huggingface_hubsnapshot_download 下载特定来源或文件部分。

注意事项

  • 数据集仅含元数据,不含文本内容(因许可证限制)
  • lang 列使用 ISO 639-3 代码,越南语值应为 vie 而非 vi
  • 多个修订版本同时存在于仓库中,过滤时需按文件名前缀选择特定修订版本
  • 数据集大小会随摄入运行而增长,表中的数字反映最后一次运行 gao store index 时的状态

许可证

数据集采用自定义的宽松许可证(per-document-open-permissive-attribution-restricted-unredistributable),许可证详情可通过提供的 GitHub 链接查看。

搜集汇总
数据集介绍
vitweb-rejects 数据集图片
构建方式
该数据集源自gao爬虫的拒绝记录,详尽收录了146,936份越南语网页文档的元数据,涵盖被拒页面、拒绝阶段、原因及判定依据。构建过程中,针对每个被拒页面记录其被拒的具体环节(如抓取、提取、筛选等)、拒绝理由(如重复、过短、机器人限制等)及当时测量的各项指标,形成一份结构化、可追溯的拒绝日志。数据以Parquet格式存储,并附带parts.csv清单,便于按源或快照进行索引与读取。
特点
该数据集的核心特点在于其作为“被拒页面”的档案性价值,填补了传统语料库仅收录“幸存者”的空白。每条记录不仅包含拒绝原因,还附带了当时的测量数据(如重复率、音节数)和判定阈值,使得研究者能够重新审视过滤标准,评估其合理性。此外,数据集还充当了爬虫的重定向映射与机器人协议记录,揭示了网站访问的完整图景。其列设计精细,涵盖42个字段,包括文档识别、来源追溯、语言判定、版权状态等,为多维度分析提供了坚实基础。
使用方法
该数据集适用于多类研究场景。研究者可通过DuckDB或Python的datasets库进行高效查询,按拒绝阶段、原因等维度统计,了解爬虫的请求分布与过滤逻辑。更重要的是,依据记录中的测量值,可模拟调整过滤阈值,评估对语料构成的影响,而无需重新爬取。此外,通过分析robots拒绝记录,可区分网站“未提供”与“明确拒绝”的差异,为网络内容可获取性研究提供数据支持。数据集的列式存储与列摘要设计,使得针对特定列的分析(如语言、音节数)能够快速执行,降低资源消耗。
背景与挑战
背景概述
ViTweb Rejects数据集由越南语网络语料库项目gao于2026年创建,由研究团队tamnd等开发,旨在记录网络爬虫在构建越南语预训练语料库时拒绝的网页元数据。该数据集包含146,936份文档的拒绝记录,涵盖被拒阶段、原因及判定依据的测量值,作为被保留语料库的补充,为语料库构建中的过滤决策提供透明化依据。其核心研究问题在于揭示语料库构建中的隐性过滤过程,使研究者能够审视、复现并调整过滤阈值,从而提升语料库构建的可解释性和可重复性。该数据集对低资源语言(如越南语)的自然语言处理研究具有重要影响,为网络语料库的过滤策略提供了实证基础,并推动了语料库构建中元数据记录与审计的实践。
当前挑战
该数据集所应对的领域挑战包括:其一,语料库构建中过滤决策的不透明性——传统语料库仅保留最终文本,导致被过滤页面的原因和标准无从追溯,而ViTweb Rejects通过记录拒绝阶段、原因和测量值,实现了过滤过程的可审计性;其二,过滤阈值调整的成本——重新设定阈值需重新爬取,而该数据集允许在无需重新抓取的情况下,基于存储的测量值进行离线重过滤,从而优化资源利用。构建过程中面临的挑战包括:需处理异构来源的复杂元数据,如robots.txt规则、HTTP状态码和重复率等,并确保格式统一;同时,需在遵守版权和许可限制的前提下发布数据,因此仅提供元数据而非文本,以避免侵犯原始网页的授权要求。
常用场景
经典使用场景
作为越南语网络语料库构建与清洗流程的伴随性元数据集合,ViTweb Rejects 记录了爬虫在抓取、提取、筛选等各阶段拒斥页面的详尽信息,包括拒斥阶段、原因及量化指标。研究者可借此审视语料构建中的过滤阈值与决策逻辑,复现并评估清洗管线的合理性,亦可将其与保留语料结合,开展语料构成分析、过滤策略优化及爬虫行为审计等经典研究场景。
衍生相关工作
基于此数据集可衍生多项后续工作,如构建更为精细的语料质量评估框架,利用拒斥样本训练分类器以改进预测模型;开展跨语种过滤策略的对比研究,提炼普适性的清洗准则;开发可视化分析工具,辅助研究者直观探索语料构成与拒斥分布。此外,其提供的详细拒斥元数据亦可支撑关于数据许可与版权管理的研究,为开放语料库的合规性建设提供参考案例。
数据集最近研究
最新研究方向
数据集‘ViTweb Rejects’的最新研究方向聚焦于构建一个前所未有的‘被拒页面’元数据档案,旨在揭示大规模语料库构建过程中过滤机制的透明性与可审计性。其前沿意义在于,通过记录爬虫在抓取、提取、筛选各阶段拒绝页面的具体原因(如重复率、长度、机器人协议、语言识别等)及其量化指标,该数据集为自然语言处理社区提供了一面‘镜子’,使研究者能够逆向评估语料清洗策略的有效性与潜在偏差。这一创举不仅填补了语料库构建中‘幸存者偏差’研究的空白,还为可复现的、细粒度的语料质量审计开辟了新路径,对越南语预训练模型的鲁棒性与公平性研究具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务