遇见数据集

family-archival-scans

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

该数据集是用于bobpanil/family家谱项目的原始档案页面扫描。包含来自五个档案机构的50个档案单元,共6475个文件。所有记录均为1943年之前,涉及已故人士,不包含任何在世个人信息。数据按持有档案馆及其参考编号组织,包括华沙AGAD、伊万诺-弗兰科夫斯克州档案馆、利沃夫中央国家历史档案馆、奥伦堡州档案馆等。内容涵盖犹太教和东正教教区登记册、出生、死亡、结婚记录,以及美国国家档案馆微缩胶片、全加利西亚数据库搜索截图、纽约市历史生命记录索引CSV等。图像文件为原始扫描,未重新压缩,部分单元提供压缩WebP版本。适用于家谱研究、手写文本识别、历史人口统计学等任务。数据通过HTTPS公开访问,无需凭证。

This dataset is a collection of original archival page scans for the bobpanil/family genealogy project. It contains 6475 files from 50 archival units across five archival institutions. All records are dated before 1943 and pertain to deceased individuals, containing no personal information of living persons. The data is organized by holding archive and reference number, including AGAD Warsaw, Ivano-Frankivsk State Archives, Central State Historical Archives of Lviv, Orenburg State Archives, etc. The content covers Jewish and Orthodox parish registers, birth, death, and marriage records, as well as microfilms from the National Archives of the United States, screenshot images from the All-Galicia Database, and CSV files of the New York City Historical Vital Records Index. The image files are original scans without recompression, and some units offer compressed WebP versions. The dataset is suitable for genealogy research, handwriting text recognition, historical demography, and other tasks. Data is publicly accessible via HTTPS without credentials.

创建时间:
2026-09-01
原始信息汇总

数据集概述:Family archival scans

该数据集是家族档案扫描件,包含来自多个档案机构的原始文献扫描图像,用于 bobpanil/family 家谱项目。数据集公开可读,无需凭证即可通过 HTTPS 直接访问。

基本信息

  • 数据规模:共 6,475 个文件,涵盖 50 个档案单元,来自 5 个保存机构
  • 时间范围:所有记录均早于 1943 年
  • 内容性质:仅涉及已故人员信息,不包含在世个人数据
  • 许可协议:其他(other)

数据集结构

文件夹按保存档案馆分组,再按档案馆自身的档案编号(fond-opis-file 格式)组织,主要包含以下目录:

目录 来源机构
agad/ 波兰华沙中央历史档案档案馆(AGAD)
daifo/ 乌克兰伊万诺-弗兰科夫斯克州档案馆(DAIFO)
tsdial/ 乌克兰利沃夫中央国家历史档案馆(TsDIAL)
ogaoo/ 俄罗斯奥伦堡州档案馆(ОГАОО)
nara/ 美国国家档案馆微缩胶片
jewishgen/ All Galicia Database 搜索截屏
misc/ 零散证书和一次性截屏
nyc/ 纽约市历史人口记录索引(CSV)
compressed/ 选定单元的 WebP 低质量镜像

各机构内容详情

AGAD(华沙)——犹太人口登记册

  • Fond 1/300/0:犹太人口登记册(Księgi metrykalne wyznania mojżeszowego),涵盖出生、死亡、婚姻记录,地点包括 Budzanów、Czortków、Trembowla 等,时间跨度约为 1877–1942 年,共 14 个档案单元。
  • Fond 1/424/0:东小波兰犹太宗教社区记录(Akta gmin wyznania mojżeszowego),包括民事状态记录和社区记录,时间跨度约为 1905–1942 年,共 7 个档案单元。

DAIFO(伊万诺-弗兰科夫斯克)——犹太教堂人口册

  • 斯坦尼斯拉沃夫(Stanisławów)犹太教堂的婚姻与死亡记录,时间范围为 1924–1925 年,共 4 个档案单元(281 张图像)。

TsDIAL(利沃夫)——犹太教区记录

  • 含 Jezierzany/Ozeryany 的死亡(1816–1876)和婚姻(1849–1876)记录等,共 6 个档案单元(386 张图像)。

ОГАОО(奥伦堡)——俄罗斯东正教教区登记册

  • 奥伦堡宗教法庭(Оренбургская духовная консистория,1800–1918 年)的俄罗斯东正教教区登记册(非犹太记录),涵盖多个村庄的出生、婚姻、死亡记录,时间范围为 1874–1905 年,共 14 个档案单元。
  • 其中多个单元仅为完整档案中的“婚姻部分”或“死亡部分”摘录,文件保留档案馆原始扫描编号。

其他内容

  • NARA:SS Aquitania 乘客名单(埃利斯岛,1921 年 2 月 22 日)
  • JewishGen:Weiser 姓氏的搜索结果截屏
  • NYC:纽约市死亡证明索引 CSV(3,725,986 行,240 MB)及数据字典

文件命名与质量说明

  • 各档案单元的文件命名规则不同,各档案馆按自身规则命名,不宜假设统一模式
  • 多数 AGAD 单元附带每页 XML 元数据旁车文件;无 XML 的单元带有 metryczka(登记卡)图像
  • 原始图像未经过重新压缩、缩放或重新编码compressed/ 目录提供 WebP 格式的低质量镜像
  • 部分单元附带 SOURCE.md(档案识别信息)、ocr/(页面笔记及行转录)和 crops/(细节放大图)
  • 转录内容中的不确定读法以 ? 标注,OCR 输出不被视为权威

访问方式

  • 无需令牌,直接通过 resolve/main 链接访问,需跟随 302 重定向
  • 单页图像通常较大(2–3 MB,最大可达 9 MB),建议分批获取,避免长时连续批量下载

来源与权利

扫描件由上述保存机构制作,通过其公共查看器获取;AGAD 对其扫描件记录的权利状态为“完整”(Pełne)。数据集为家谱研究目的而复制,各保存机构仍为原始来源jewishgen/ 内容归 Gesher Galicia 项目所有;nyc/ 索引为 NYC Open Data 数据。

搜集汇总
数据集介绍
family-archival-scans 数据集图片
构建方式
该数据集源自一个家谱研究项目,收录了来自五个档案机构、五十个档案单元的六千余份原始档案扫描件。构建时遵循各机构自身的档案编号体系,如fond-opis-file格式,并辅以目录、摘要及逐页元数据。所有图像均由档案馆官方扫描获取,未做任何二次处理,确保史料原始性与可追溯性。
特点
数据集覆盖1943年前多个地区不同族群的原始档案,尤其以加利西亚犹太社区记录为核心,包含出生、死亡、婚姻及社区记录,时间跨度从19世纪初至20世纪中叶。图像分辨率高,部分扫描超过万像素,适合精细辨认手写体。同时辅以完整的来源说明、转录文件及索引,便于跨库关联和深度考据。
使用方法
用户可公开访问并直接通过HTTPS获取图像,无需任何凭证。建议按档案目录浏览,检索时可采用档案索引或OCR目录。使用中应遵循档案馆引用规则,并注意手写文本识别的不确定性,转录文档以问号标识存疑字符。该数据集适用于家谱学、历史人口学及手写文本识别等研究领域。
背景与挑战
背景概述
该数据集由个体研究者bobpanil创建,用于其家族谱系项目,旨在汇集并公开散落于多国档案馆的原始档案扫描件。数据集创建于2023年及以后,涵盖了来自波兰华沙、乌克兰利沃夫、伊万诺-弗兰科夫斯克及俄罗斯奥伦堡等地档案馆的五十个档案单元,总计6475份文件,时间跨度自19世纪初至1943年前,涉及犹太教与东正教社区的人口动态记录、移民名单及历史文献。该数据集的独特价值在于其跨机构、跨语种的整合性,以及以高清分辨率呈现原始手稿为手写文本识别等计算方法的开发提供了宝贵的语料,对历史人口学、谱系学及数字人文研究具有重要的参考意义。
当前挑战
该领域及数据集构建面临的挑战主要包括:其一,档案手稿多为德文、波兰文、乌克兰文和希伯来文的草书体,时代特征显著,通用OCR技术难以准确识别,如何发展针对历史手稿的可靠识别与转录方法,仍是该领域研究的核心难点。其二,不同档案馆对文件的命名、元数据及扫描标准各异,整合与规范化极为耗时;例如部分文件无目录或索引,其内容边界与归属需通过逐页抽样及内部信息比对加以判定。其三,在数据集构建中,确保原始材料的完整性、准确性及来源的可追溯性亦具挑战,如同档案中缺页片段的比例被如实记录,且需处理高清扫描文件在存储、传输及访问中的技术限制与版权伦理问题。
常用场景
经典使用场景
该数据集作为家谱学和历史人口统计学研究的珍贵史料库,汇集了加利西亚、乌克兰及埃利斯岛等地的前现代档案扫描件,覆盖犹太教与东正教群体的出生、婚姻及死亡登记。其典型应用在于对手写历史文档进行数字化整理与内容提取,尤其适用于开发鲁棒的手写文本识别(HTR)与版面分析算法。研究者常利用其中的AGAD、DAIFO等机构的档案影像,训练模型识别德文、波兰文、乌克兰文及希伯来文的花体手写体,并借助XML元数据及登记卡(metryczka)结构验证自动转录的准确性,为大规模档案的自动化处理提供基准数据集。
解决学术问题
该数据集直面历史档案数字化中手稿识别的关键瓶颈,即通用OCR引擎对19至20世纪多语种花体手写的低识别率问题。通过提供未经重压缩的高分辨率原始扫描件及部分人工转录样本,它支撑了针对历史手稿的深度学习模型训练与评估,推动了跨语言手写识别、版面理解及命名实体识别等技术的发展。同时,其详尽的档案来源与完整性校验(如与AGAD登记卡核对页数)为数据可靠性设立了高标准,使研究人员能够量化转录误差,促进了一套可复现的档案数字化方法论的建立,对数字人文和历史信息学产生了深远影响。
衍生相关工作
围绕此数据集已衍生出一系列方法学探索与工具开发工作,尤其集中于历史手稿的识别与信息抽取管线。相关经典工作包括:基于该数据集的高分辨率扫描件,研究者构建了针对花体德语(Kurrent)、波兰语及希伯来语的手写识别模型,突破了通用OCR的局限;其独特的目录结构(按档案馆及原始编号组织)启发了档案数据整理的最佳实践,即维护未修改的原始文件并辅以详细的SOURCE.md溯源文件。此外,数据集中所展示的部分卷宗识别策略,例如通过抽样扫描和解读页眉来界定档案片段的方法,也被借鉴于其它无目录档案的数字化预处理工作中,体现了其在方法论层面的广泛影响力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务