遇见数据集

German Patents (1877–1918)

收藏
arXiv2025-12-23 更新2025-12-24 收录
官方服务:

资源简介:

该数据集由曼海姆大学的研究团队构建,涵盖1877至1918年间的德国专利条目,总计306,070条,数据源为9,562张档案图像扫描。数据集采用双栏格式,每页包含20至50条专利条目,字体包括哥特体和罗马体。通过多模态大语言模型(如Gemini-2.5-Pro和Gemini-2.5-Flash-Lite)自动提取专利ID、受让人、地点、标题和日期等关键变量,显著提升了数据构建效率和质量。该数据集旨在为经济史研究提供微观经济数据支持,帮助分析技术创新及其经济影响。

This dataset was constructed by a research team at the University of Mannheim, covering 306,070 German patent entries from 1877 to 1918, with source data derived from 9,562 scanned archival images. The dataset adopts a two-column layout, with each page containing 20 to 50 patent entries and fonts including Gothic and Roman typefaces. Key variables such as patent ID, assignee, location, title and date were automatically extracted via multimodal large language models (e.g., Gemini-2.5-Pro and Gemini-2.5-Flash-Lite), which significantly improved the efficiency and quality of dataset construction. This dataset aims to provide microeconomic data support for economic history research, enabling analysis of technological innovation and its economic impacts.

提供机构:
曼海姆大学
创建时间:
2025-12-23
搜集汇总
数据集介绍
German Patents (1877–1918) 数据集图片
构建方式
在历史经济学研究中,构建大规模微观数据集长期面临高成本与低效率的挑战。本数据集通过创新的多模态大语言模型技术,从1877年至1918年德国专利登记册的9,562幅档案图像扫描中提取了306,070项专利条目。其构建流程采用基于Gemini-2.5-Pro和Gemini-2.5-Flash-Lite的双阶段流水线设计:第一阶段由Gemini-2.5-Pro从每幅图像中提取专利条目与技术类别,并利用Gemini-2.5-Flash-Lite修复跨页或跨栏的截断条目;第二阶段则由Gemini-2.5-Flash-Lite从每条完整条目中精确解析专利编号、权利人、所在地、专利标题及日期五个关键变量。整个流程通过精心设计的提示词进行迭代优化,并辅以人工校验与清洗,确保了数据结构的规范性与内容的准确性。
特点
该数据集在历史专利研究领域具有显著的代表性与技术前瞻性。其核心特征体现在数据来源的权威性与完整性,涵盖了德意志帝国时期四十一年间全部专利记录,为技术创新史研究提供了前所未有的微观基础。数据内容包含专利编号、权利人、所在地、专利标题及日期五个结构化变量,能够支持多维度的计量分析。尤为突出的是,数据集构建过程充分应对了历史文档的复杂性:原始图像采用双栏排版,混合使用哥特体与罗马体字体,且存在跨页跨栏的条目延续现象。通过多模态大语言模型的强大视觉与语言理解能力,数据集不仅实现了高效率的自动化提取,更在字符错误率等指标上超越了人工转录的精度,为历史文档的数字化处理树立了新的范式。
使用方法
该数据集为经济史、技术史与创新研究领域的学者提供了丰富的实证材料。研究者可直接利用其结构化数据,开展关于专利活动时空分布、创新网络演化、权利人特征分析等主题的定量研究。数据集包含的技术类别信息便于进行跨领域的技术轨迹比较,而权利人所在地数据则支持地理经济学视角下的创新扩散分析。在使用过程中,建议结合历史背景对数据进行语境化解读,例如注意战时专利编号的缺失等特殊记录。数据集已完全开源,并附有详细的构建流水线与基准测试结果,用户可根据研究需求对原始图像进行复核或调整提取流程。对于希望拓展研究范围的研究者,该流水线设计具备良好的适应性,可迁移至其他历史图像语料库,从而降低非技术背景学者构建大规模历史数据集的门槛。
背景与挑战
背景概述
德国专利数据集(1877–1918)由曼海姆大学的研究团队于近期构建,旨在应对经济史学界长期面临的微观数据匮乏困境。该数据集源于德意志帝国专利局于1877年至1918年间逐年发布的专利登记册,共包含306,070项专利条目,覆盖了德国工业化进程中的关键创新时期。其核心研究问题在于如何高效、精准地将大量档案图像扫描件转化为结构化数据,以支持对技术创新驱动因素、专利持有者特征及其地理分布等微观经济议题的深入探究。该数据集的创建标志着多模态大语言模型在历史数据构建领域的范式转移,为经济史研究提供了前所未有的微观数据基础,有望重塑该领域对长期创新动力与制度变迁的理解。
当前挑战
该数据集致力于解决从复杂历史档案中自动提取结构化信息的核心挑战。首要难题在于图像源材料的异质性:专利条目采用双栏排版,且字体在罗马体与哥特体之间切换,并包含大量历史拼写与特殊符号,这对传统光学字符识别方法构成了严峻考验。在构建过程中,研究团队面临多重技术障碍:需要设计能够精准分割并识别跨页、跨栏专利条目的算法流程;必须克服多模态大语言模型在转录历史字体时可能产生的幻觉与错误;同时需确保提取的变量(如专利号、持有者、地点、标题与日期)在大量条目中保持高度一致性。此外,如何在保证数据质量的前提下,以远低于人工成本的方式高效处理9,562幅图像扫描件,亦是该数据集构建中需要平衡的关键挑战。
常用场景
经典使用场景
在创新经济学与历史计量学领域,德国专利数据集(1877–1918)为探究技术创新与经济增长的长期关联提供了经典素材。该数据集收录了德意志帝国时期超过三十万项专利的微观记录,涵盖专利持有者、地理位置、技术类别及申请日期等关键变量,使得研究者能够深入分析工业革命后期德国技术进步的轨迹、空间分布特征及其与制度变迁的互动关系。
衍生相关工作
该数据集的构建方法衍生了一系列关于历史文档信息提取的基准研究与应用探索。例如,Greif等人基于类似流程评估了多模态大模型对哥特体与罗马体印刷文档的光学字符识别性能;Bäcker-Peral等人则将其应用于历史表格数据的面板数据集构建,验证了模型输出与人工标注数据在计量分析中的一致性。这些工作共同推动了基于大语言模型的自动化史料处理成为经济史研究的新兴范式。
数据集最近研究
最新研究方向
在历史经济学与数字人文的交叉领域,German Patents (1877–1918) 数据集的构建标志着多模态大语言模型在历史档案数字化中的前沿应用。该研究利用 Gemini-2.5-Pro 和 Gemini-2.5-Flash-Lite 等先进模型,从 9,562 幅档案图像扫描中自动化提取了 306,070 项专利条目,展现了处理复杂历史文档(如哥特体与罗马体混合排版、双栏格式)的卓越能力。这一方法不仅将数据集构建效率提升了 795 倍以上,成本降低至传统人工方法的 1/205,更通过基准测试初步证实了多模态大语言模型在数据质量上可能超越人工辅助。当前研究热点聚焦于模型在信息提取中的幻觉控制、跨字体与低资源语言的泛化性能评估,以及历史微观经济数据的规模化生成。这一进展正推动经济史学从数据稀缺向数据丰裕转型,为创新史、技术扩散等研究提供了前所未有的微观基础,同时引发了关于自动化数据构建对学术实践与历史解释影响的深层讨论。
相关研究论文
  • 1
    Multimodal LLMs for Historical Dataset Construction from Archival Image Scans: German Patents (1877-1918)曼海姆大学 · 2025年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务