vitweb-rejects
收藏资源简介:
ViTweb Rejects 是一个仅包含元数据的越南语数据集,记录了爬虫在抓取过程中拒绝的页面。该数据集包含来自公共网络语料库的146,936个文档,以Parquet格式存储,总大小22.1 MB。每条记录对应一个被拒绝的页面,并包含拒绝阶段(如crawl.fetch、crawl.sift等)、拒绝原因(如robots、fetch、boilerplate、language、short、repetition等)以及用于判断的测量指标(如重复率、音节数等)。数据集没有文本内容,仅包含元数据,包括42个标准列(如doc_id、url、host、lang、n_syllables等)和额外的3个拒绝相关列(reject_stage、reject_reason、reject_detail)。该数据集可用于分析爬虫的拒绝模式、重新调整过滤阈值、检查机器人记录、比较不同语料库的覆盖范围等。数据由开源项目gao生成,基于多个公共语料库(如CulturaX、mC4、OSCAR等)但仅包含被拒绝的页面。
ViTweb Rejects is a metadata-only Vietnamese dataset that records pages rejected by the crawler during the crawling process. The dataset contains 146,936 documents from public web corpora, stored in Parquet format with a total size of 22.1 MB. Each record corresponds to a rejected page and includes the rejection stage (e.g., crawl.fetch, crawl.sift), rejection reason (e.g., robots, fetch, boilerplate, language, short, repetition), and measurement metrics used for judgment (e.g., repetition rate, number of syllables). The dataset has no text content, only metadata, including 42 standard columns (e.g., doc_id, url, host, lang, n_syllables) and 3 additional rejection-related columns (reject_stage, reject_reason, reject_detail). It can be used to analyze crawler rejection patterns, readjust filtering thresholds, check robot records, compare coverage across different corpora, etc. The data is generated by the open-source project gao, based on multiple public corpora (e.g., CulturaX, mC4, OSCAR) but only contains rejected pages.
ViTweb Rejects 数据集详情
数据集简介
ViTweb Rejects 是一个仅包含元数据的越南语数据集,记录了 gao 爬虫在抓取过程中拒绝的网页信息。数据集包含 146,936 个越南语文档,以 Parquet 格式存储,总大小为 22.1 MB,共 28 个文件部分。
数据内容
每个数据行代表一个被爬虫拒绝的页面,包含以下关键信息:
- 拒绝阶段:记录页面在爬取的哪个环节被拒绝(如抓取、提取、筛选等阶段)
- 拒绝原因:以单词形式记录的原因(如 robots、fetch、boilerplate、language、short、repetition 等)
- 拒绝详情:包含具体数值的详细拒绝原因描述
- 测量指标:页面被判断时依据的各种测量数据
数据来源
数据来源于公开语料库(web 来源),固定于 web-20260819、web-20260820、web-20260820b 三个修订版本。同时,数据集的清单文件(parts.csv)提供了每个文件部分的来源、快照、输入文件、文档数量和大小信息。
数据结构
存储布局
README.md parts.csv data/web/ web-20260819-00000-00000.parquet ... 共28个文件
列信息
数据集包含 42 列,主要类别包括:
- 身份标识:
doc_id、raw_id(blake3 哈希值) - 文本信息:
text(标准化文本)、n_chars(字符数)、n_syllables(越南语音节数)、n_tokens(token数) - 来源信息:
source、source_locator、url、host、url_template、fetched_at - 抓取信息:
http_status、robots_decision、robots_rule、robots_hash、tdm_signals、consent - 筛选信息:
lang(ISO 639-3 语言代码)、lang_score、diacritics、translated、gao_qual、gao_edu、heuristics - 内容属性:
license_class、license_evidence、structure、register - 去重信息:
dup_cluster、dup_cluster_size、is_representative - 隐私信息:
pii_level、pii_types、pii_spans - 拒绝相关:
reject_stage、reject_reason、reject_detail - 其他:
schema_version、pipeline_version、contam_flags、upstream_fields、media_type、extractor
应用场景
- 分析爬虫请求分布:通过拒绝阶段和原因,了解爬虫在哪些环节丢失了页面
- 重新过滤数据:基于拒绝时记录的测量数据,可在不重新爬取的情况下调整过滤阈值
- 检查robots协议记录:区分哪些网站未被提供、哪些网站明确拒绝访问
使用方式
DuckDB 查询
支持通过 DuckDB 远程直接查询 Parquet 文件,无需下载整个数据集。
Python 加载
支持 datasets 库流式加载和 huggingface_hub 的 snapshot_download 下载特定来源或文件部分。
注意事项
- 数据集仅含元数据,不含文本内容(因许可证限制)
lang列使用 ISO 639-3 代码,越南语值应为vie而非vi- 多个修订版本同时存在于仓库中,过滤时需按文件名前缀选择特定修订版本
- 数据集大小会随摄入运行而增长,表中的数字反映最后一次运行
gao store index时的状态
许可证
数据集采用自定义的宽松许可证(per-document-open-permissive-attribution-restricted-unredistributable),许可证详情可通过提供的 GitHub 链接查看。




