遇见数据集

Institutional Newspapers Dataset

收藏
arXiv2026-08-19 更新2026-08-21 收录
官方服务:

资源简介:

Institutional Newspapers Dataset由哈佛法学院·Institutional Data Initiative与波士顿公共图书馆联合创建,旨在从历史报纸扫描中提取高质量结构化数据。该数据集包含从1795年至1930年的1,473,635份公共领域报纸扫描中分割出的8310万独立裁剪区域,其OCR输出总计163亿个o200k_base词元。数据集通过模块化管道生成,依次执行版面分割、OCR、类型分类、阅读顺序检测、命名实体识别、主题分类及嵌入生成等步骤,每个环节均保持可解释性与可定制性。该数据集主要用于赋能历史计算研究、改善大语言模型的预训练数据质量,并促进图书馆对馆藏报纸的深度访问与挖掘。

The Institutional Newspapers Dataset was co-created by the Harvard Law School Institutional Data Initiative and the Boston Public Library, with the objective of extracting high-quality structured data from historical newspaper scans. This dataset comprises 83.1 million independent cropped regions segmented from 1,473,635 public-domain newspaper scans spanning the period from 1795 to 1930, and its accumulated OCR outputs total 1.63 billion o200k_base tokens. The dataset is generated via a modular pipeline that sequentially performs layout segmentation, OCR, type classification, reading order detection, named entity recognition, topic classification, and embedding generation, with each step maintaining interpretability and customizability. This dataset is primarily utilized to empower historical computational research, improve the quality of pre-training data for large language models (LLMs), and facilitate in-depth access and mining of library-preserved newspaper collections.

创建时间:
2026-08-19
搜集汇总
数据集介绍
Institutional Newspapers Dataset 数据集图片
构建方式
该数据集源自哈佛大学法学院图书馆与波士顿公共图书馆的深度合作,旨在从海量历史报纸扫描件中提取高质量的结构化数据。构建过程依托一套模块化的处理管线,首先利用基于YOLO26x的目标检测模型对每份扫描件进行版面分割,生成独立的‘裁剪块’;随后,对每个裁剪块分别执行Tesseract与专用视觉语言模型的OCR识别,并辅以语言检测、文本分析、裁剪类型分类、阅读顺序检测、命名实体识别、主题分类及预计算嵌入生成等步骤。整个管线在保持计算经济性的同时,确保每一步骤的可解释性与可定制性,最终从1,473,635份公共领域报纸扫描件中提取出83,147,041个裁剪块,其OCR输出总计达163亿个o200k_base标记。
特点
该数据集的核心特色在于其‘原子化’的粒度与多维度的丰富标注。每个裁剪块不仅包含精确的边界框坐标,还附带来自两种OCR引擎的文本输出、类型分类(如内容、广告、图片等)、阅读顺序索引、命名实体、主题类别以及图像与文本嵌入向量。此外,数据集还创新性地融入了来自Chronicling America的种族、族裔、移民等主题词表匹配结果,为数字人文研究提供了独特的视角。其多语言覆盖(包含意第绪语、德语、瑞典语等)反映了波士顿移民社区的历史面貌,而预计算的嵌入向量则极大地提升了数据集的即用性与检索效率。
使用方法
数据集以Parquet格式分片存储,每片含250次扫描,压缩采用zstd标准,便于高效加载与分布式处理。用户可通过Hugging Face平台获取全部数据、模型及处理管线代码,并附有Agent Skill文件以支持代理式应用。针对研究需求,数据集支持多种下游任务:基于嵌入向量进行语义检索或聚类分析,利用OCR文本训练或微调语言模型,借助类型与主题标注开展版面演化或广告内容的历史研究。同时,详细的数据字段说明文档(附录E)为使用者提供了清晰的列语义与来源标识(_src、_ext、_gen、_exp后缀),确保数据的可追溯性与可靠性,适用于从数字人文到AI预训练等广泛场景。
背景与挑战
背景概述
历史报纸作为公共生活的珍贵记录,其蕴含的巨量信息在数字化时代却因版面复杂、扫描质量参差而难以被高效挖掘。为突破这一瓶颈,哈佛大学法学院图书馆所属的机构数据计划联合波士顿公共图书馆,于2026年推出机构报纸数据集。该数据集由Matteo Cargnelutti等研究者共同创建,聚焦于从1795年至1930年间逾147万页公共领域报纸扫描中提取高质量文本,共计生成约163亿个o200k_base令牌,覆盖8310万个独立版面区块。此数据集不仅为大规模语言模型预训练提供了丰富素材,也为数字人文学者研究历史事件、社会变迁提供了前所未有的数据支撑,其影响力已延伸至Talkie-LM等前沿项目,被视为解锁海量历史报纸数据的关键一步。
当前挑战
该领域面临的核心挑战在于历史报纸版面的高密度、不规则性及噪声干扰,使得通用工具难以精准处理。传统OCR引擎在复杂版面下错误频出,而视觉语言模型虽能提升识别率,却易产生幻觉和令牌循环,且计算成本高昂。构建过程中,研究团队不得不设计模块化流水线,分离分割与分类任务,训练轻量级模型以兼顾效率与精度。此外,阅读顺序检测、命名实体识别等步骤在历史语境下均存在性能瓶颈,语言检测对多语种支持有限,零样本主题分类的可信度也较低。这些挑战共同构成了从扫描图像到高质量结构化数据转化过程中的重重障碍。
常用场景
经典使用场景
Institutional Newspapers Dataset 作为历史报纸数字化的里程碑式资源,其经典使用场景聚焦于大规模、高精度的报纸内容解析与结构化抽取。该数据集覆盖1795至1930年间逾147万份公共领域报纸扫描,通过模块化流水线生成83.1百万个版面切块,并附带OCR文本、版面类型、命名实体、主题标签、语言标识及预计算向量等多层标注,为历史学、数字人文学及计算社会科学研究者提供了前所未有的、可直接用于计算分析的颗粒度数据,显著降低了对原始扫描图像的依赖,使量化文本分析、跨报比较与时序演变研究成为可能。
衍生相关工作
该数据集及其发布的流水线、模型催生了多项后续研究与实践。其识别与分类方法启发了一系列针对历史文档版面的优化模型,例如在阅读顺序推断上探索更鲁棒的变换器架构,或针对特定馆藏微调轻量级OCR模型以减少错误。数据集本身亦被用作训练语料,支撑了诸如Talkie-LM这类专注预现代数据的大语言模型训练,验证了历史报纸数据对提升模型历史知识理解的价值。同时,其社区驱动的发布形式与Agent Skill文件,促进了数据集在数字人文领域的多样化应用,衍生出如事件抽取、舆论演化分析、广告史量化研究等学术分支,形成了以高质量历史文本数据为核心的研究生态。
数据集最近研究
最新研究方向
该数据集聚焦于从海量历史报纸扫描件中提取高质量、结构化文本资源的自动化管线构建,其最新研究方向强调通过模块化、可解释且计算高效的流程实现大规模报纸内容的原子化解析。研究不仅关注版面分割、光学字符识别(OCR)与文本增强,还深入探索了阅读顺序推断、命名实体识别、主题分类及多语言检测等技术的集成优化,旨在为大型语言模型的预训练提供丰富、可信的历史语料。这一方向与数字人文中历史报刊的深度挖掘、跨学科研究以及文化遗产的智能化访问紧密相关,其影响力体现在推动AI训练数据的多样化与历史文本的可计算性,为理解过去的社会、文化与政治事件提供了前所未有的数据基础。
相关研究论文
  • 1
    Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers哈佛法学院·Institutional Data Initiative; 波士顿公共图书馆; 哈佛法学院图书馆; 哈佛法学院·工程与应用科学学院·肯尼迪学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务