JustQuiteMadMax/Wikisource-OCR-uk-clean-expanded
收藏资源简介:
--- dataset_info: features: - name: Title dtype: string - name: Text dtype: string - name: image dtype: image - name: Text_Cleaned dtype: string - name: Title_Cleaned dtype: string - name: Book_Title dtype: string splits: - name: train num_bytes: 2741899584 num_examples: 15857 - name: validation num_bytes: 652405065 num_examples: 3773 download_size: 3296092251 dataset_size: 3394304649 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* ---
dataset_info: features: - name: 标题(Title) dtype: 字符串(string) - name: 文本(Text) dtype: 字符串(string) - name: 图像(image) dtype: 图像 - name: 清洗后文本(Text_Cleaned) dtype: 字符串(string) - name: 清洗后标题(Title_Cleaned) dtype: 字符串(string) - name: 书籍标题(Book_Title) dtype: 字符串(string) splits: - name: 训练集(train) num_bytes: 2741899584 num_examples: 15857 - name: 验证集(validation) num_bytes: 652405065 num_examples: 3773 download_size: 3296092251 dataset_size: 3394304649 configs: - config_name: 默认配置(default) data_files: - split: 训练集(train) path: data/train-* - split: 验证集(validation) path: data/validation-*



