遇见数据集

dh-unibe/image-text_parlamentsdienste-protokolle

收藏
Hugging Face2026-04-04 更新2026-04-05 收录
官方服务:

资源简介:

--- dataset_info: config_name: default features: - name: image dtype: image: decode: false - name: xml_content dtype: string - name: filename dtype: string - name: project_name dtype: string splits: - name: train num_examples: 479 num_bytes: 13996110802 download_size: 13996110802 dataset_size: 13996110802 configs: - config_name: default data_files: - split: train path: data/train/**/*.parquet tags: - image-to-text - htr - trocr - transcription - pagexml license: mit --- # Dataset Card for transkribus-exports-280089-1-raw-xml This dataset was created using pagexml-hf converter from Transkribus PageXML data. ## Dataset Summary This dataset contains 479 samples across 1 split(s). Geographical scope: Switzerland<br>Period: 1848-1900<br>Languages: German, French<br>Type of document: Protocols<br>Provenance: Swiss Federal Archives ### Projects Included - 1849_01 - 1849_02 - 1849_03 - 1849_04 - 1849_05 - 1849_06 - 1849_07 - 1849_08 - 637157213248534270_verkleinert ## Dataset Structure ### Data Splits - **train**: 479 samples ### Dataset Size - Approximate total size: 13347.73 MB - Total samples: 479 ### Features - **image**: `Image(mode=None, decode=False)` - **xml_content**: `Value('string')` - **filename**: `Value('string')` - **project_name**: `Value('string')` ## Data Organization Data is organized as parquet shards by split and project: ``` data/ ├── <split>/ │ └── <project_name>/ │ └── <timestamp>-<shard>.parquet ``` The HuggingFace Hub automatically merges all parquet files when loading the dataset. ## Usage ```python from datasets import load_dataset # Load entire dataset dataset = load_dataset("dh-unibe/transkribus-exports-280089-1-raw-xml") # Load specific split train_dataset = load_dataset("dh-unibe/transkribus-exports-280089-1-raw-xml", split="train") ```

数据集信息: 配置名称:默认(default) 特征项: - 名称:图像(image),数据类型: 图像类型,解码(decode)设为false - 名称:XML内容(xml_content),数据类型:字符串(string) - 名称:文件名(filename),数据类型:字符串(string) - 名称:项目名称(project_name),数据类型:字符串(string) 数据划分: - 名称:训练集(train),样本数量:479,字节数:13996110802 下载大小:13996110802 数据集总大小:13996110802 配置项: - 配置名称:默认,数据文件: - 数据划分:训练集,路径:data/train/**/*.parquet 标签: - 图像到文本(image-to-text) - 手写文本识别(htr) - TrOCR(trocr) - 转录(transcription) - PageXML(pagexml) 许可证:MIT许可证(mit) --- # transkribus-exports-280089-1-raw-xml 数据集卡片 本数据集基于Transkribus的PageXML数据,通过pagexml-hf转换器生成。 ## 数据集概览 本数据集包含1个数据划分,共计479个样本。 地理覆盖范围:瑞士<br>研究时段:1848-1900<br>涉及语言:德语、法语<br>文档类型:会议纪要<br>数据来源:瑞士联邦档案馆(Swiss Federal Archives) ### 包含的项目 - 1849_01 - 1849_02 - 1849_03 - 1849_04 - 1849_05 - 1849_06 - 1849_07 - 1849_08 - 637157213248534270_verkleinert ## 数据集结构 ### 数据划分 - **训练集(train)**:共479个样本 ### 数据集规模 - 近似总大小:13347.73 MB - 总样本量:479 ### 特征项说明 - **图像(image)**:`Image(mode=None, decode=False)` - **XML内容(xml_content)**:`Value('string')` - **文件名(filename)**:`Value('string')` - **项目名称(project_name)**:`Value('string')` ## 数据组织方式 数据按数据划分与项目名称组织为Parquet分片,目录结构如下: data/ ├── <split>/ │ └── <project_name>/ │ └── <timestamp>-<shard>.parquet Hugging Face Hub 在加载数据集时会自动合并所有Parquet文件。 ## 使用示例 python from datasets import load_dataset # 加载完整数据集 dataset = load_dataset("dh-unibe/transkribus-exports-280089-1-raw-xml") # 加载指定数据划分 train_dataset = load_dataset("dh-unibe/transkribus-exports-280089-1-raw-xml", split="train")

提供机构:
dh-unibe
搜集汇总
数据集介绍
dh-unibe/image-text_parlamentsdienste-protokolle 数据集图片
构建方式
在历史文献数字化领域,该数据集通过Transkribus平台对瑞士联邦档案馆所藏的议会会议记录进行系统化处理而构建。原始文档涵盖1848年至1900年间以德语和法语撰写的协议文本,利用PageXML格式进行结构化标注,再经由pagexml-hf转换工具将图像与对应的XML内容整合为标准化数据条目。整个过程确保了历史文献从扫描图像到机器可读文本的精准映射,为跨模态研究提供了坚实基础。
特点
该数据集的核心特点在于其跨模态性质,每一样本均包含原始文档图像与对应的结构化XML文本,实现了视觉信息与语义内容的紧密关联。数据覆盖瑞士议会早期历史阶段,语言以德语和法语为主,具有明确的历史地理范围和时间跨度。样本总量为479条,虽规模适中,但数据组织采用分片式Parquet格式,支持高效存储与加载,特别适用于手写文本识别和文档分析任务。
使用方法
使用该数据集时,可通过HuggingFace的datasets库直接加载,支持整体数据集或特定分割的灵活调用。加载后的数据以图像、XML内容、文件名和项目名称等特征呈现,便于研究者进行端到端的手写文本识别模型训练或历史文档分析。数据按项目名称分目录存储,Parquet文件自动合并机制简化了数据处理流程,为学术实验与应用开发提供了便捷接口。
背景与挑战
背景概述
在数字人文与历史档案学领域,对历史文档的数字化与内容解析是推动学术研究的关键环节。image-text_parlamentsdienste-protokolle数据集由瑞士联邦档案馆与相关研究机构合作创建,旨在收录1848年至1900年间瑞士议会会议记录的扫描图像及其对应的XML文本内容。该数据集聚焦于多语言历史手写文档的自动转录问题,通过整合图像与结构化文本数据,为手写文本识别技术提供了珍贵的训练资源,对促进历史文献的自动化处理与知识挖掘具有深远影响。
当前挑战
该数据集致力于解决历史手写文档的自动转录与多语言文本识别挑战,其核心问题在于如何准确解析19世纪瑞士议会记录中复杂的德文与法文手写体。在构建过程中,研究人员面临文档图像质量不均、手写字体风格多样以及历史墨水褪色导致的识别困难。此外,将原始PageXML格式数据转换为标准化数据集时,需克服数据标注一致性、多项目整合与大规模图像存储的技术障碍,这些因素共同构成了数据集构建与应用的重要挑战。
常用场景
经典使用场景
在历史文档数字化与文化遗产保护领域,该数据集为手写文本识别(HTR)和光学字符识别(OCR)研究提供了珍贵素材。其核心应用场景在于训练和评估端到端的图像到文本转换模型,例如TrOCR等先进架构,以自动化转录19世纪瑞士议会协议的手写或印刷文档。通过结合图像与对应的XML结构化内容,研究者能够深入探索多语言(德语、法语)历史文本的自动转录技术,推动文档数字化进程的精准性与效率。
解决学术问题
该数据集有效应对了历史文档处理中的若干学术挑战,包括低质量扫描图像的文本识别、多语言混合文档的转录一致性,以及手写字体变异的建模问题。其意义在于为数字人文研究提供了标准化、可复现的实验基准,促进了跨学科合作,使学者能够量化分析历史文本的内容与演变,从而深化对19世纪瑞士政治与社会变迁的理解,并为文化遗产的长期保存与可访问性奠定技术基础。
衍生相关工作
围绕该数据集,已衍生出多项经典研究工作,主要集中在改进HTR模型对历史手写体的适应性,以及开发针对PageXML格式的文本提取与后处理流程。例如,基于TrOCR框架的微调研究显著提升了多语言历史文档的转录准确率;同时,结合布局分析与语义标注的混合方法,进一步优化了结构化信息的抽取效果,为后续的文本挖掘与历史分析任务提供了可靠的技术支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务