遇见数据集

think-dataset-clean

收藏
Hugging Face2026-07-05 更新2026-07-06 收录
官方服务:

资源简介:

think-dataset-clean是jbduran/think-dataset数据集的清理版本,通过基于Michael Hla过滤方法的Colab笔记本生成。清理过程中,设计上保留了整本书籍作为数据行,并跳过了1900年后物理学关键词的过滤器,以有意保留截至20世纪30年代的文本。数据处理采用了适度的GPT-2令牌对数先验概率范围(p2.5-p97.5)进行过滤,源数据分片与输出分片保持一一对应的基础名称映射。数据集已完成473个分片的处理,原始输入文档共计160,263份,清理后保留了149,745份文档,保留率为93.44%;移除了10,518份文档,移除率为6.56%。在字符层面,清理后版本保留了原始版本约89.50%的字符。被移除的文档主要归因于三类:先验概率过高(3,991份)、先验概率过低(3,838份)以及OCR识别伪影(2,689份)。

think-dataset-clean is a cleaned version of the dataset jbduran/think-dataset, generated via a Colab notebook based on Michael Hlas filtering method. The cleaning process is designed to preserve entire books as data rows and skips filters for physics keywords post-1900 to intentionally retain texts up to the 1930s. Data processing uses a moderate GPT-2 token log prior probability range (p2.5-p97.5) for filtering, with a one-to-one base name mapping between source and output shards. According to current reports, the dataset has processed 473 shards, with 160,263 original input documents, retaining 149,745 documents after cleaning (93.44% retention rate) and removing 10,518 documents (6.56% removal rate). At the character level, the cleaned version retains approximately 89.50% of the original characters. Removed documents are primarily attributed to three categories: high prior probability (prior_high, 3,991 documents), low prior probability (prior_low, 3,838 documents), and OCR artifacts (ocr_artifacts, 2,689 documents).

创建时间:
2026-06-30
原始信息汇总

数据集概述:think-dataset-clean

基本信息

  • 数据集名称:think-dataset-clean
  • 来源:对 jbduran/think-dataset 的清洗版本
  • 许可证:未指定

数据特征

  • 仅包含一个字段:text(字符串类型)

设计选择

  • 行结构:完整书籍保留为单独一行
  • 时间范围:有意保留直至1930年代的文本,跳过了1900年后的物理学关键词过滤
  • 过滤策略:采用适中的 GPT-2 token 对数先验带(p2.5-p97.5)
  • 分片映射:每个源分片对应一个同基本名称的输出分片

清洗报告

指标 数值 百分比
已处理分片 473 -
输入文档数 160,263 -
保留文档数 149,745 93.44%
移除文档数 10,518 6.56%
保留字符数(相较于原始) - 89.50%

移除原因统计

移除原因 移除数量
prior_high(先验过高) 3,991
prior_low(先验过低) 3,838
ocr_artifacts(OCR伪影) 2,689

处理工具

  • 基于 Colab 笔记本,采用了 Michael Hla 的 Machina Mirabilis / gpt1900 过滤方法
搜集汇总
数据集介绍
think-dataset-clean 数据集图片
构建方式
本数据集为`jbduran/think-dataset`的清洁版本,基于Michael Hla的Machina Mirabilis/gpt1900过滤流程,依托Colab笔记本实现构建。原始书籍以完整行形式保留,未采用1900年后的物理关键词过滤器,以容纳直至1930年代的文本。采用适中的GPT-2令牌对数先验带(p2.5-p97.5)进行筛选,每个源分片映射至同基名的一个输出分片。共计处理160,263份文档,保留149,745份(93.44%),删除10,518份(6.56%),保留字符占比89.50%。
特点
该数据集的核心特点在于其精炼的过滤策略与广泛的文本覆盖范围。通过保留直至1930年代的完整书籍,它兼顾了历史文献的完整性。基于GPT-2令牌对数先验的筛选带有效去除了低质量内容,同时避免了过度清除。删除原因包括`prior_high`(3,991例)、`prior_low`(3,838例)和`ocr_artifacts`(2,689例),体现了对文本纯净度的细致把控。整体上,数据集在保持高保留率的基础上,大幅提升了文本质量。
使用方法
数据集以简单的格式呈现,每条记录包含一个`text`字段,数据类型为字符串,适合直接用于文本分析、语言模型训练或预微调任务。用户可通过Hugging Face的`datasets`库加载数据,例如使用`load_dataset('think-dataset-clean')`命令。由于书籍以完整行形式存储,易于切分或整合,适用于需要长序列上下文的任务。建议在使用前根据下游需求进行必要的分词或子集划分,以适配具体模型架构。
背景与挑战
背景概述
think-dataset-clean数据集是对jbduran/think-dataset的清洗版本,由研究人员基于Michael Hla的Machina Mirabilis/gpt1900过滤方法,通过Colab笔记本生成。该数据集的核心研究问题在于保留20世纪30年代以前的文本,涵盖完整书籍作为数据行,旨在为历史文献分析与自然语言处理提供高质量语料。其创建背景源于对早期文本数据噪声和OCR伪影的消除需求,通过引入GPT-2 token对数先验带(p2.5-p97.5)实现精细过滤,对推动历史语料库的构建和低资源时代的语言模型训练具有重要影响力。
当前挑战
该数据集面临的核心领域挑战在于精准区分与保留1900-1930年间富含历史与科学价值的内容,同时剔除OCR伪影和噪声文本,避免过度过滤导致信息丢失。构建过程中的具体挑战包括:平衡先验高值与低值文档的剔除阈值,如prior_high(3,991条)与prior_low(3,838条)的高占比;处理OCR伪影(2,689条)对文本质量的影响;以及确保每个源分片映射至单一输出分片时,保持跨域文本的完整性和连续性,最终实现149,745条文档(93.44%)的高保留率与89.50%的字符保留率。
常用场景
经典使用场景
在自然语言处理与数字人文交叉研究领域,think-dataset-clean作为经过精心清洗的历史语料库,常被用于训练面向20世纪初期文献的语言模型。研究者利用该数据集的低噪声特性,开展文本风格迁移、历史术语演化分析以及早期科学文献的语义建模。其保留完整书籍结构的特性,使其尤其适合进行篇章级语义理解和长文本生成任务的基准测试。
解决学术问题
该数据集有效解决了历史语料中光学字符识别(OCR)噪声和低质量文本的干扰问题,为20世纪初期学术文献的计量分析提供了高质量数据基础。通过剔除后验概率异常和OCR伪影,它使得研究者能够更准确地追踪物理学、哲学等学科概念在1900至1930年间的语义漂移,推动了历史语言学与科学知识图谱构建方法的范式革新。
衍生相关工作
该数据集衍生出多个经典工作,包括基于GPT-2先验分布的文本质量过滤方法论(如Machina Mirabilis框架),以及针对历史文献的OCR后处理纠错模型。学界还在此基础上开发了面向1900年代科学文本的领域词嵌入库,并催生了若干跨语种的历史文档对齐数据集,进一步拓展了低资源历史语料在预训练语言模型微调中的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务