dh-unibe/image-text_rats-und-richtebuecher_xv-xvi
收藏资源简介:
--- dataset_info: config_name: default features: - name: image dtype: image: decode: false - name: xml_content dtype: string - name: filename dtype: string - name: project_name dtype: string splits: - name: train num_examples: 9885 num_bytes: 70729250850 download_size: 70729250850 dataset_size: 70729250850 configs: - config_name: default data_files: - split: train path: data/train/**/*.parquet tags: - image-to-text - htr - trocr - transcription - pagexml license: mit --- # Dataset Card for image-text_rats-und-richtebuecher_xv-xvi This dataset was created using pagexml-hf converter from Transkribus PageXML data. ## Dataset Summary This dataset contains 9885 samples across 1 split(s). Geographical scope: Switzerland<br>Period: 1400-1550<br>Languages: Middle High German, Early Modern German<br>Type of document: Protocols<br>Provenance: State Archive of Zurich ### Projects Included - Rats-undRichtebücher_MF_1_3543 - Rats-undRichtebücher_MF_1_3544 - Rats-undRichtebücher_MF_1_3545 - Rats-undRichtebücher_MF_1_3546 - Rats-undRichtebücher_MF_1_3547 - Rats-undRichtebücher_MF_1_3548 - Rats-undRichtebücher_MF_1_3549 - Rats-undRichtebücher_MF_1_3550 - Rats-undRichtebücher_MF_1_3551 - Rats-undRichtebücher_MF_1_3552 - Rats-undRichtebücher_MF_1_3553 - Rats-undRichtebücher_MF_1_3554 - Rats-undRichtebücher_MF_1_3555 - Rats-undRichtebücher_MF_1_3556 - Rats-undRichtebücher_MF_1_3557 - Rats-undRichtebücher_MF_1_3558 - Rats-undRichtebücher_MF_1_3559 - Rats-undRichtebücher_MF_1_3560 - Rats-undRichtebücher_MF_1_3561 - Rats-undRichtebücher_MF_1_3562 - Rats-undRichtebücher_MF_1_3563 - Rats-undRichtebücher_MF_1_3564 - Rats-undRichtebücher_MF_1_3565 - Rats-undRichtebücher_MF_1_3566 - Rats-undRichtebücher_MF_1_3567 - Rats-undRichtebücher_MF_1_3568 - Rats-undRichtebücher_MF_1_3569 - Rats-undRichtebücher_MF_1_3570 - Rats-undRichtebücher_MF_1_3571 - Rats-undRichtebücher_MF_1_3572 - Rats-undRichtebücher_MF_1_3573 - Rats-undRichtebücher_MF_1_3574 - Rats-undRichtebücher_MF_1_3575 - TRAINING_VALIDATION_SET_Richtebuecher_M1 - Test_MF_1_3556_p_204 - escript_test - escript_test_2 ## Dataset Structure ### Data Splits - **train**: 9885 samples ### Dataset Size - Approximate total size: 67452.67 MB - Total samples: 9885 ### Features - **image**: `Image(mode=None, decode=False)` - **xml_content**: `Value('string')` - **filename**: `Value('string')` - **project_name**: `Value('string')` ## Data Organization Data is organized as parquet shards by split and project: ``` data/ ├── <split>/ │ └── <project_name>/ │ └── <timestamp>-<shard>.parquet ``` The HuggingFace Hub automatically merges all parquet files when loading the dataset. ## Usage ```python from datasets import load_dataset # Load entire dataset dataset = load_dataset("dh-unibe/image-text_rats-und-richtebuecher_xv-xvi") # Load specific split train_dataset = load_dataset("dh-unibe/image-text_rats-und-richtebuecher_xv-xvi", split="train") ```




