dajor85570/invoices-and-receipts_ocr_v1
收藏资源简介:
--- configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* - split: valid path: data/valid-* dataset_info: features: - name: image dtype: image - name: id dtype: string - name: parsed_data dtype: string - name: raw_data dtype: string splits: - name: train num_bytes: 465061949.289 num_examples: 2043 - name: test num_bytes: 23808463.0 num_examples: 125 - name: valid num_bytes: 22325731.0 num_examples: 70 download_size: 281665599 dataset_size: 511196143.289 --- # Dataset Card for "invoices-and-receipts_ocr_v1" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
配置项: - 配置名称:默认(default) 数据文件: - 数据集拆分:训练集(train) 路径:data/train-* - 数据集拆分:测试集(test) 路径:data/test-* - 数据集拆分:验证集(valid) 路径:data/valid-* 数据集信息: 特征字段: - 字段名:图像(image) 数据类型(dtype):图像 - 字段名:标识符(id) 数据类型(dtype):字符串 - 字段名:解析后数据(parsed_data) 数据类型(dtype):字符串 - 字段名:原始数据(raw_data) 数据类型(dtype):字符串 数据集拆分: - 拆分名称:训练集(train) 字节大小:465061949.289 样本数量:2043 - 拆分名称:测试集(test) 字节大小:23808463.0 样本数量:125 - 拆分名称:验证集(valid) 字节大小:22325731.0 样本数量:70 下载总大小:281665599 数据集总大小:511196143.289 --- # 数据集卡片(Dataset Card):"invoices-and-receipts_ocr_v1" [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集卡片 "invoices-and-receipts_ocr_v1"
配置
- 默认配置 (
default)- 数据文件:
- 训练集 (
train):data/train-* - 测试集 (
test):data/test-* - 验证集 (
valid):data/valid-*
- 训练集 (
- 数据文件:
数据集信息
-
特征:
image: 图像数据id: 字符串parsed_data: 字符串raw_data: 字符串
-
数据分割:
- 训练集 (
train):- 字节数: 465,061,949.289
- 样本数: 2,043
- 测试集 (
test):- 字节数: 23,808,463.0
- 样本数: 125
- 验证集 (
valid):- 字节数: 22,325,731.0
- 样本数: 70
- 训练集 (
-
下载大小: 281,665,599
-
数据集大小: 511,196,143.289




