OpenTransformer/web-crawl-2026
收藏资源简介:
--- license: apache-2.0 task_categories: - text-generation language: - en tags: - web-crawl - pretraining - nlp - text-corpus pretty_name: Web Crawl 2026 size_categories: - 10B<n<100B --- # Web Crawl 2026 A large-scale web crawl dataset for language model pretraining, collected by the OpenTransformer project. ## Dataset Description This dataset contains text extracted from web pages crawled directly from the internet using custom high-throughput crawlers. All data is freshly scraped. ### Data Format Each record is a JSON line (gzipped) with fields: - text: extracted text content (200-200,000 chars) - url: source URL - domain: source domain - timestamp: crawl timestamp (ISO 8601) - source: crawler identifier (crawl_rust_v1, crawl_go_v1, crawl_v5) ### Collection Methods Three crawlers run in parallel on a Vast.ai GPU box (Titan Xp, $0.06/hr): | Crawler | Language | Throughput | 1.2GB Chunk Time | Architecture | |---------|----------|------------|-------------------|-------------| | crawl_rust | Rust | 150-300 docs/s | 5-6 min | 500 async workers, tokio | | crawl_go | Go | 11 docs/s | ~2 hrs | 150 goroutines | | crawl_v5.py | Python | 0.8 docs/s | ~25 hrs | 20 async workers | The Rust crawler is 27x faster than Go and 375x faster than Python. ### Rust Crawler Architecture Source code: crawler/rust/ Key design decisions: - 500 concurrent async workers via tokio + semaphore-based backpressure - Background queue refiller: seed fetching runs in a separate task, never blocks crawling - Pre-generated seed file: 593K URLs from Common Crawl index (12 crawl versions x 20 TLD patterns) - Link discovery: extracts up to 50 links per crawled page, shuffled for domain diversity - Content dedup: MD5 hash of first 500 chars, stored in DashMap (lock-free concurrent hashmap) - Domain throttling: max 1000 pages per domain to ensure diversity - Streaming gzip: writes compressed JSONL chunks (~1.2GB raw -> ~350MB compressed) - Auto-upload: each completed chunk is uploaded to HuggingFace Hub Seed sources: 1. Common Crawl URL index (CC-MAIN-2024-10 through CC-MAIN-2025-08) 2. Wikipedia random articles API (20K articles) 3. Sitemaps from 34 major sites (Reuters, BBC, Nature, StackOverflow, etc.) 4. Hacker News top/new/best stories Performance on Titan Xp box ($0.06/hr): - Phase 1: 562K seeds loaded in 28 seconds - Phase 2: 150-300 docs/s sustained throughput - ~1.2GB chunk every 5-6 minutes - ~12-15 GB/hour of raw crawled text - Cost: ~$0.004 per GB of crawled text ### Building and Running Install Rust, then: cd crawler/rust cargo build --release ulimit -n 65536 ./target/release/crawl_rust > crawl.log 2>&1 ### Quality Filtering - HTML text extraction via scraper crate (article/main/body selectors) - Minimum 200 chars, maximum 200K chars - Content-type filtering (only text/html) - URL filtering: blocks social media, login pages, media files, admin pages - Deduplication via MD5 content hash ## Intended Use Pretraining data for the AGILLM-3 language model (698M params, joint AR+SAT architecture). ## License Apache 2.0
--- license: apache-2.0 task_categories: - 文本生成 language: - 英文(en) tags: - 网页爬取 - 预训练 - 自然语言处理(Natural Language Processing,NLP) - 文本语料库 pretty_name: Web Crawl 2026 size_categories: - 100亿 < 数据量 < 1000亿 --- # Web Crawl 2026 本数据集为面向大语言模型(Large Language Model,LLM)预训练的大规模网页爬取数据集,由OpenTransformer项目采集。 ## 数据集概览 本数据集包含通过自研高吞吐量爬虫直接从互联网爬取的网页文本,所有数据均为全新爬取所得。 ### 数据格式 每条数据为一条经gzip压缩的JSON行(JSON Lines),包含以下字段: - text: 提取的文本内容(字符数范围200至200,000) - url: 来源URL - domain: 来源域名 - timestamp: 爬取时间戳(遵循ISO 8601标准) - source: 爬虫标识(如crawl_rust_v1、crawl_go_v1、crawl_v5) ### 采集方法 三款爬虫并行运行于Vast.ai平台的GPU节点(Titan Xp,每小时0.06美元): | 爬虫名称 | 开发语言 | 吞吐量 | 1.2GB分块耗时 | 架构设计 | |---------|----------|------------|-------------------|-------------| | crawl_rust | Rust | 150~300 文档/秒 | 5~6分钟 | 500个异步工作线程,基于Tokio框架 | | crawl_go | Go | 11 文档/秒 | 约2小时 | 150个协程(goroutine) | | crawl_v5.py | Python | 0.8 文档/秒 | 约25小时 | 20个异步工作线程 | Rust编写的爬虫速度是Go版本的27倍,是Python版本的375倍。 ### Rust爬虫架构 源代码路径:crawler/rust/ 核心设计思路: - 基于Tokio框架实现500个并发异步工作线程,并通过信号量机制实现背压控制 - 后台队列填充器:种子URL获取任务独立运行,不会阻塞主爬取流程 - 预生成种子文件:包含来自Common Crawl索引的59.3万个URL(覆盖12个爬取版本与20个顶级域名模板) - 链接发现:每爬取一个页面最多提取50条链接,并对链接进行洗牌以保证域名多样性 - 内容去重:取文本前500个字符计算MD5哈希,存储于DashMap(无锁并发哈希表)中 - 域名限流:每个域名最多爬取1000个页面,以保证数据多样性 - 流式gzip压缩:写入压缩后的JSONL分块(原始数据约1.2GB → 压缩后约350MB) - 自动上传:每个完成的分块都会自动上传至HuggingFace Hub 种子URL来源: 1. Common Crawl URL索引(覆盖CC-MAIN-2024-10至CC-MAIN-2025-08共12个版本) 2. 维基百科随机文章API(包含2万个随机文章) 3. 34个主流站点的站点地图(如路透社、BBC、《自然》期刊、StackOverflow等) 4. Hacker News的热门、最新、最佳故事列表 在Titan Xp节点(每小时0.06美元)上的性能表现: - 阶段1:28秒内加载56.2万个种子URL - 阶段2:稳定维持150~300文档/秒的吞吐量 - 每5~6分钟生成一个1.2GB的原始数据分块 - 原始爬取文本量约为12~15GB/小时 - 成本:每爬取1GB文本约需0.004美元 ### 编译与运行 先安装Rust语言环境,随后执行以下命令: cd crawler/rust cargo build --release ulimit -n 65536 ./target/release/crawl_rust > crawl.log 2>&1 ### 质量过滤规则 - 通过scraper库提取HTML文本(匹配article、main、body等选择器) - 文本字符数下限为200,上限为200,000 - 内容类型过滤:仅保留text/html类型的响应 - URL过滤:屏蔽社交媒体、登录页面、媒体文件、管理页面等链接 - 通过MD5内容哈希实现去重 ## 预期用途 用于AGILLM-3大语言模型的预训练数据(该模型参数量为6.98亿,采用AR+SAT联合架构)。 ## 许可证 Apache 2.0




