遇见数据集

JustQuiteMadMax/Wikisource-OCR-uk-clean-expanded

收藏
Hugging Face2026-04-09 更新2026-04-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: Title dtype: string - name: Text dtype: string - name: image dtype: image - name: Text_Cleaned dtype: string - name: Title_Cleaned dtype: string - name: Book_Title dtype: string splits: - name: train num_bytes: 2741899584 num_examples: 15857 - name: validation num_bytes: 652405065 num_examples: 3773 download_size: 3296092251 dataset_size: 3394304649 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* ---

dataset_info: features: - name: 标题(Title) dtype: 字符串(string) - name: 文本(Text) dtype: 字符串(string) - name: 图像(image) dtype: 图像 - name: 清洗后文本(Text_Cleaned) dtype: 字符串(string) - name: 清洗后标题(Title_Cleaned) dtype: 字符串(string) - name: 书籍标题(Book_Title) dtype: 字符串(string) splits: - name: 训练集(train) num_bytes: 2741899584 num_examples: 15857 - name: 验证集(validation) num_bytes: 652405065 num_examples: 3773 download_size: 3296092251 dataset_size: 3394304649 configs: - config_name: 默认配置(default) data_files: - split: 训练集(train) path: data/train-* - split: 验证集(validation) path: data/validation-*

提供机构:
JustQuiteMadMax
二维码
社区交流群
二维码
科研交流群
商业服务