遇见数据集

think-dataset

收藏
Hugging Face2026-06-12 更新2026-06-13 收录
官方服务:

资源简介:

Think-Dataset是一个从机构书籍中经过严格筛选构建的大规模英文文本数据集,旨在为语言模型训练提供高质量、历史悠久的英文语料。数据集主要包含1930年之前出版的英文书籍内容,通过多重过滤标准确保数据质量:语言为英文且英文比例超过90%,OCR识别准确率不低于90%且差异在10%以内,文本可分词性得分不低于95%,并剔除过短文本片段(如至少500个词元)。数据经过条形码去重处理,采用随机洗牌策略打散源顺序聚类,并基于条形码哈希值划分验证集。最终数据集包含约20.2万行文本,总字符数超过1187亿,分为473个数据分片(472个训练分片,1个验证分片),涵盖广泛主题,其中语言与文学占28.62%,哲学、心理学、宗教占18.44%,法律占8.61%,科学占8.30%。数据以Parquet格式存储,仅包含一个名为`text`的字符串列,兼容nanochat等训练框架。

Think-Dataset is a large-scale English text dataset constructed through rigorous screening from institutional books, with the core purpose of providing high-quality, historically rich English corpora for language model training. The dataset primarily includes content from English books published before 1930. The data construction process applies multiple filtering criteria: ensuring the language is English with an English proportion exceeding 90%; OCR recognition accuracy (both source and generated text) is no less than 90%, with differences within 10%; text tokenizability score is no less than 95%; and overly short text fragments are removed (requiring at least 500 tokens, 2000 characters, 3 pages, or 20 sentences). Additionally, deduplication is performed using barcodes. In terms of data organization, a random shuffling strategy is employed to break up source order clustering, and the validation set is deterministically partitioned based on barcode hash values. The final dataset contains approximately 202,000 lines of text, with a total character count exceeding 118.7 billion, divided into 473 data shards (472 training shards, 1 validation shard). The data covers a wide range of topics, with the top categories being Language and Literature (28.62%), Philosophy, Psychology, Religion (18.44%), Law (8.61%), and Science (8.30%). The dataset is stored in Parquet format with a simple schema containing only one string column named `text`, designed for compatibility with training frameworks such as nanochat.

创建时间:
2026-06-04
原始信息汇总

Think-Dataset (Filtered from Institutional Books) 数据集详情

数据集概览

  • 来源:从机构图书(Institutional Books)中筛选而成。
  • 总原始记录数:983,004 条。
  • 筛选后记录数:202,470 条(通过率 20.60%)。
  • 总字符数:118,745,375,871。
  • 总分片数:473 个(训练集 472 片,验证集 1 片)。
  • 验证集:最后一个分片 shard_00472.parquet

筛选规则

  • 语言(language_gen):必须为英语("eng")。
  • 英语比例(language_distribution_gen):英语占比 ≥ 0.9。
  • 年份(date1_src / date2_src):解析年份 < 1930,无日期或无效日期类型被拒绝。
  • OCR 得分(ocr_score_src / ocr_score_gen):均 ≥ 90.0。
  • OCR 一致性|src - gen| ≤ 10.0
  • 分词得分(tokenizability_score):≥ 95.0。
  • 文本长度:token ≥ 500,字符 ≥ 2000,页数 ≥ 3,句子 ≥ 20(除非 token 异常)。

去重策略

  • 通过 likely_duplicates_barcodes_gen 条形码去重,保留首次出现的代表记录。

多样性策略

  • 洗牌缓冲区:前 449 个分片使用 20 GB 缓冲区,后 23 个分片(450-472)使用 8 GB 缓冲区以减少 Colab 内存压力。
  • 验证集划分:基于条形码哈希的确定性划分,条件为 crc32(barcode) % 370 == 0,约包含 1000 本书。

拒绝原因统计(非精确值)

拒绝原因 数量
日期类型无效(date_type_invalid) 235,713
重复(duplicate) 35,229
语言不匹配(language) 1,172,869
语言分布缺失(language_distribution_missing) 3,059
英语比例过低(language_low_english_proportion) 207,550
OCR 得分低(ocr_low) 209,112
OCR 缺失(ocr_missing) 3
分词得分低(tokenizability_low) 45,564
分词得分缺失(tokenizability_missing) 12
句子数过少(too_few_sentences) 3
年份过新(year_too_recent) 22,962
年份无法解析(year_unparseable) 612

语言筛选估计

  • 英语排除量估计:约 543,200 本书(55.3%)被语言过滤移除(基于 50,000 条记录的干运行推算)。

年份来源分布

  • date1_src:202,458 条。
  • date2_src:12 条。

主题分布(部分)

主题 数量 占比
语言与文学(LANGUAGE AND LITERATURE) 45,863 28.62%
哲学、心理学、宗教(PHILOSOPHY. PSYCHOLOGY. RELIGION) 29,548 18.44%
法律(LAW) 13,798 8.61%
科学(SCIENCE) 13,308 8.30%
美洲历史(HISTORY OF THE AMERICAS) 9,543 5.95%
社会科学(SOCIAL SCIENCES) 8,603 5.37%
历史辅助科学(AUXILIARY SCIENCES OF HISTORY) 5,404 3.37%
农业(AGRICULTURE) 5,290 3.30%
政治科学(POLITICAL SCIENCE) 4,966 3.10%
教育(EDUCATION) 4,381 2.73%
技术(TECHNOLOGY) 3,733 2.33%
地理、人类学、娱乐(GEOGRAPHY. ANTHROPOLOGY. RECREATION) 3,433 2.14%
美术(FINE ARTS) 3,192 1.99%
医学(MEDICINE) 3,034 1.89%
音乐(MUSIC AND BOOKS ON MUSIC) 1,573 0.98%
世界历史(WORLD HISTORY AND HISTORY OF EUROPE, ASIA, AFRICA, AUSTRALIA, NEW ZEALAND, ETC.) 1,481 0.92%
海军科学(NAVAL SCIENCE) 1,000 0.62%
通用作品(GENERAL WORKS) 914 0.57%
军事科学(MILITARY SCIENCE) 829 0.52%
书目、图书馆学、信息资源(BIBLIOGRAPHY. LIBRARY SCIENCE. INFORMATION RESOURCES) 321 0.20%
未知(UNKNOWN) 49 0.03%

数据模式

  • :单一字符串列 text
  • 压缩:ZSTD-3,行组大小 64。
  • 元数据:每个分片的主题分布存储在 manifest.json 中;文档级别的审计元数据存储在 audit_metadata.jsonl 中;训练分片仅包含文本。

使用方式(配合 nanochat)

  • 将数据集重命名为 base_data_climbmix/(与 nanochat/dataset.py 中的 DATA_DIR 常量匹配),或修改该常量指向当前目录。
  • 然后依次运行: bash python -m scripts.tok_train && python -m scripts.tok_eval python -m scripts.base_train --depth=12 --window-pattern=L
搜集汇总
数据集介绍
think-dataset 数据集图片
构建方式
Think-Dataset源自对机构图书资源的精细过滤与去重处理,旨在构建高质量、高纯度的英文文本语料库。构建流程首先依据严格的语言筛选规则,保留英语比例不低于90%的书籍,并限定出版年份早于1930年,以确保内容的经典性与历史价值。随后,通过OCR评分与文本可分词性评分等质量指标进行多轮过滤,剔除低质量与碎片化片段。去重阶段利用条形码识别技术保留首次出现的代表本。为平衡数据多样性与主题分布,采用单次混洗缓冲区策略,随机驱逐超限书籍以打破源顺序聚类,同时保持语料库的自然主题分布。最终,通过条形码哈希确定性地划分出约1000本书作为验证集,形成473个分片,其中训练集472个,验证集1个。
使用方法
Think-Dataset的使用轻便灵活,可直接融入nanochat等自然语言处理框架。数据集以ZSTD-3压缩的Parquet格式存储,单列文本结构,行组大小为64,兼容`nanochat/dataset.py`的数据加载接口。用户仅需将数据集目录重命名为`base_data_climbmix/`,或修改配置常量指向该目录,即可无缝接入训练流程。典型应用包括重新训练分词器:依次运行`python -m scripts.tok_train`与`python -m scripts.tok_eval`,随后执行`python -m scripts.base_train`并指定网络深度与窗口模式。验证集通过条形码哈希固定划分,确保实验的可复现性。此外,`manifest.json`文件提供了每个分片的主题分布,方便用户按需筛选或分析数据子集。
背景与挑战
背景概述
Think-Dataset 是一个从大规模机构图书语料库中精心筛选的高质量英文文本数据集,由相关研究团队于近年构建,旨在为语言模型预训练提供纯净、结构化且历史跨度明确的训练素材。其核心研究问题聚焦于如何通过严格的过滤与去重策略,从海量书稿中提取具有高光学字符识别质量(OCR score ≥ 90)、高可分词性(tokenizability ≥ 95%)且出版年份早于1930年的文本,以规避现代版权问题并保证文本的学术与历史价值。该数据集包含约202,470本书籍,总计超1187亿字符,覆盖了从哲学、宗教到科学技术等20余个主题领域,其中语言文学类占比最高(28.62%),其次为哲学与宗教(18.44%)及法律(8.61%)。其严格的构建流程和详细的元数据架构,为后续研究者在LLM训练数据净化、历史文本挖掘及跨领域语料分析等方面提供了坚实的数据基础,影响了数据筛选方法论在自然语言处理领域的演进。
当前挑战
该数据集所解决的领域挑战主要体现在:1)大规模语料的质量控制问题——原始语料包含大量低质量OCR文本、非英语内容及格式混乱的书籍,需通过多维度评分(语言分布、OCR一致性、字符长度等)确保数据纯净,最终仅20.6%的源数据通过筛选;2)版权与时效性平衡——通过限定出版年份早于1930年,在合法范围内保留具有历史研究价值的文本,但面临年份解析失败(612条)及日期格式无效(235,713条)等数据清洗难题。构建过程中亦遇到显著挑战:去重机制依赖条形码哈希,但存在约35,229条重复记录需剔除;语言过滤环节因中断重跑导致拒绝计数不准确,估计约55.3%的书籍因语言问题被移除;此外,受限于计算资源(如Colab内存限制),打乱缓冲大小从20GB降至8GB,可能引入轻微的源文件排序偏差,需通过随机淘汰策略缓解聚类现象。
常用场景
经典使用场景
Think-Dataset 是一个经过严格筛选与去重的高质量英文文本语料库,其核心设计在于为大语言模型的预训练提供纯净、可靠且主题多样的训练材料。经典使用场景集中于语言模型的因果语言建模任务,研究者可直接将其作为基石语料,用于训练从零开始的 Transformer 架构或对已有模型进行持续预训练。数据集的单一 `text` 字段设计与 `nanochat` 框架的无缝兼容,使得加载与处理流程极度简化,特别适合那些关注模型基础语言能力、知识覆盖与长文本建模的学术探索。其基于光学字符识别评分、可分词性阈值及出版年份的多重过滤机制,确保了输入文本的清晰度与规范性,为复现和对比不同规模的模型实验提供了稳定的数据基准。
解决学术问题
该数据集有效回应了自然语言处理领域中高质量公开语料匮乏的核心困境。许多研究受限于噪声过多、版权模糊或主题偏斜的网页爬取数据,难以准确评估模型架构改进或训练策略优化的真实效果。Think-Dataset 通过严格的过滤流水线——包括语言纯度、OCR 质量、跨模态一致性及文本碎片控制——显著降低了数据污染对实验结论的干扰,使得学术社区能够更专注地探究缩放定律、最优训练分配以及知识记忆机制等根本性问题。其按主题分布的元数据(如文学、哲学、科学、法律等)还支持对模型在不同知识领域上的表现进行细粒度剖析,推动了对预训练语料组成如何影响下游泛化能力的理解。
实际应用
在工业界与开源社区中,Think-Dataset 可作为构建专用领域语言模型的基础原料。例如,其文学与哲学类高占比内容(合计逾 47%)天然适合于培养具有人文叙事能力的对话系统或辅助写作工具;科学与法律子集的均衡存在,则为开发面向科研文献摘要、法律文书辅助审查等垂直应用的模型提供了初始训练语料。得益于其非侵入性的去重策略与主题保持的混洗方法,该数据集还能被直接用于对现有大型模型进行领域适应性微调。此外,其完整的过滤记录与验证集划分机制,降低了在不同计算资源条件下复现实验的门槛,使中小型研究团队也能在可控的预算内开展有意义的预训练实验。
数据集最近研究
最新研究方向
Think-Dataset源自对机构藏书的高质量筛选与清洗,经严苛的OCR质量校验、语言纯度评定及年代核验后,保留了以英语为主、覆盖文理法哲等数十个学科门类的书籍文本。当前前沿研究方向聚焦于利用该数据集预训练语言模型的基础语义理解与推理能力,尤其在语言与文学、哲学心理学宗教、法学及科学等高频主题领域,研究者通过其纯净的文本语料提升模型对结构化知识、隐含逻辑及跨域概念的捕获与表征能力。结合大语言模型在可解释性与知识增强方面的热点,该数据集被视为构建深度思考能力基座的关键资源,其对公共领域书籍的数字化复现为开放学术环境下的认知模拟与理性推断研究提供了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务