think-dataset
收藏资源简介:
Think-Dataset是一个从机构书籍中经过严格筛选构建的大规模英文文本数据集,旨在为语言模型训练提供高质量、历史悠久的英文语料。数据集主要包含1930年之前出版的英文书籍内容,通过多重过滤标准确保数据质量:语言为英文且英文比例超过90%,OCR识别准确率不低于90%且差异在10%以内,文本可分词性得分不低于95%,并剔除过短文本片段(如至少500个词元)。数据经过条形码去重处理,采用随机洗牌策略打散源顺序聚类,并基于条形码哈希值划分验证集。最终数据集包含约20.2万行文本,总字符数超过1187亿,分为473个数据分片(472个训练分片,1个验证分片),涵盖广泛主题,其中语言与文学占28.62%,哲学、心理学、宗教占18.44%,法律占8.61%,科学占8.30%。数据以Parquet格式存储,仅包含一个名为`text`的字符串列,兼容nanochat等训练框架。
Think-Dataset is a large-scale English text dataset constructed through rigorous screening from institutional books, with the core purpose of providing high-quality, historically rich English corpora for language model training. The dataset primarily includes content from English books published before 1930. The data construction process applies multiple filtering criteria: ensuring the language is English with an English proportion exceeding 90%; OCR recognition accuracy (both source and generated text) is no less than 90%, with differences within 10%; text tokenizability score is no less than 95%; and overly short text fragments are removed (requiring at least 500 tokens, 2000 characters, 3 pages, or 20 sentences). Additionally, deduplication is performed using barcodes. In terms of data organization, a random shuffling strategy is employed to break up source order clustering, and the validation set is deterministically partitioned based on barcode hash values. The final dataset contains approximately 202,000 lines of text, with a total character count exceeding 118.7 billion, divided into 473 data shards (472 training shards, 1 validation shard). The data covers a wide range of topics, with the top categories being Language and Literature (28.62%), Philosophy, Psychology, Religion (18.44%), Law (8.61%), and Science (8.30%). The dataset is stored in Parquet format with a simple schema containing only one string column named `text`, designed for compatibility with training frameworks such as nanochat.
Think-Dataset (Filtered from Institutional Books) 数据集详情
数据集概览
- 来源:从机构图书(Institutional Books)中筛选而成。
- 总原始记录数:983,004 条。
- 筛选后记录数:202,470 条(通过率 20.60%)。
- 总字符数:118,745,375,871。
- 总分片数:473 个(训练集 472 片,验证集 1 片)。
- 验证集:最后一个分片
shard_00472.parquet。
筛选规则
- 语言(language_gen):必须为英语(
"eng")。 - 英语比例(language_distribution_gen):英语占比 ≥ 0.9。
- 年份(date1_src / date2_src):解析年份 < 1930,无日期或无效日期类型被拒绝。
- OCR 得分(ocr_score_src / ocr_score_gen):均 ≥ 90.0。
- OCR 一致性:
|src - gen| ≤ 10.0。 - 分词得分(tokenizability_score):≥ 95.0。
- 文本长度:token ≥ 500,字符 ≥ 2000,页数 ≥ 3,句子 ≥ 20(除非 token 异常)。
去重策略
- 通过
likely_duplicates_barcodes_gen条形码去重,保留首次出现的代表记录。
多样性策略
- 洗牌缓冲区:前 449 个分片使用 20 GB 缓冲区,后 23 个分片(450-472)使用 8 GB 缓冲区以减少 Colab 内存压力。
- 验证集划分:基于条形码哈希的确定性划分,条件为
crc32(barcode) % 370 == 0,约包含 1000 本书。
拒绝原因统计(非精确值)
| 拒绝原因 | 数量 |
|---|---|
| 日期类型无效(date_type_invalid) | 235,713 |
| 重复(duplicate) | 35,229 |
| 语言不匹配(language) | 1,172,869 |
| 语言分布缺失(language_distribution_missing) | 3,059 |
| 英语比例过低(language_low_english_proportion) | 207,550 |
| OCR 得分低(ocr_low) | 209,112 |
| OCR 缺失(ocr_missing) | 3 |
| 分词得分低(tokenizability_low) | 45,564 |
| 分词得分缺失(tokenizability_missing) | 12 |
| 句子数过少(too_few_sentences) | 3 |
| 年份过新(year_too_recent) | 22,962 |
| 年份无法解析(year_unparseable) | 612 |
语言筛选估计
- 英语排除量估计:约 543,200 本书(55.3%)被语言过滤移除(基于 50,000 条记录的干运行推算)。
年份来源分布
date1_src:202,458 条。date2_src:12 条。
主题分布(部分)
| 主题 | 数量 | 占比 |
|---|---|---|
| 语言与文学(LANGUAGE AND LITERATURE) | 45,863 | 28.62% |
| 哲学、心理学、宗教(PHILOSOPHY. PSYCHOLOGY. RELIGION) | 29,548 | 18.44% |
| 法律(LAW) | 13,798 | 8.61% |
| 科学(SCIENCE) | 13,308 | 8.30% |
| 美洲历史(HISTORY OF THE AMERICAS) | 9,543 | 5.95% |
| 社会科学(SOCIAL SCIENCES) | 8,603 | 5.37% |
| 历史辅助科学(AUXILIARY SCIENCES OF HISTORY) | 5,404 | 3.37% |
| 农业(AGRICULTURE) | 5,290 | 3.30% |
| 政治科学(POLITICAL SCIENCE) | 4,966 | 3.10% |
| 教育(EDUCATION) | 4,381 | 2.73% |
| 技术(TECHNOLOGY) | 3,733 | 2.33% |
| 地理、人类学、娱乐(GEOGRAPHY. ANTHROPOLOGY. RECREATION) | 3,433 | 2.14% |
| 美术(FINE ARTS) | 3,192 | 1.99% |
| 医学(MEDICINE) | 3,034 | 1.89% |
| 音乐(MUSIC AND BOOKS ON MUSIC) | 1,573 | 0.98% |
| 世界历史(WORLD HISTORY AND HISTORY OF EUROPE, ASIA, AFRICA, AUSTRALIA, NEW ZEALAND, ETC.) | 1,481 | 0.92% |
| 海军科学(NAVAL SCIENCE) | 1,000 | 0.62% |
| 通用作品(GENERAL WORKS) | 914 | 0.57% |
| 军事科学(MILITARY SCIENCE) | 829 | 0.52% |
| 书目、图书馆学、信息资源(BIBLIOGRAPHY. LIBRARY SCIENCE. INFORMATION RESOURCES) | 321 | 0.20% |
| 未知(UNKNOWN) | 49 | 0.03% |
数据模式
- 列:单一字符串列
text。 - 压缩:ZSTD-3,行组大小 64。
- 元数据:每个分片的主题分布存储在
manifest.json中;文档级别的审计元数据存储在audit_metadata.jsonl中;训练分片仅包含文本。
使用方式(配合 nanochat)
- 将数据集重命名为
base_data_climbmix/(与nanochat/dataset.py中的DATA_DIR常量匹配),或修改该常量指向当前目录。 - 然后依次运行: bash python -m scripts.tok_train && python -m scripts.tok_eval python -m scripts.base_train --depth=12 --window-pattern=L




