small_dense_structured_table
收藏资源简介:
This dataset is generated syhthetically to create tables with following characteristics: 1. Empty cell percentage in following range [0,30] (Dense) 2. There is clear seperator between rows and columns (Structured). 3. 4 <= num rows <= 10, 2 <= num columns <= 6 (Small) ### Load the dataset ```python import io import pandas as pd from PIL import Image def bytes_to_image(self, image_bytes: bytes): return Image.open(io.BytesIO(image_bytes)) def parse_annotations(self, annotations: str) -> pd.DataFrame: return pd.read_json(StringIO(annotations), orient="records") test_data = load_dataset('nanonets/small_dense_structured_table', split='test') data_point = test_data[0] image, gt_table = ( bytes_to_image(data_point["images"]), parse_annotations(data_point["annotation"]), ) ```
本数据集为合成生成,旨在构建具备如下特征的表格: 1. 空单元格占比处于[0, 30]区间内(密集型,Dense) 2. 行列间具备清晰分隔线(结构化,Structured) 3. 行数范围为4 ≤ 行数 ≤ 10,列数范围为2 ≤ 列数 ≤ 6(小型,Small) ### 数据集加载 python import io import pandas as pd from PIL import Image def bytes_to_image(self, image_bytes: bytes): return Image.open(io.BytesIO(image_bytes)) def parse_annotations(self, annotations: str) -> pd.DataFrame: return pd.read_json(StringIO(annotations), orient="records") test_data = load_dataset('nanonets/small_dense_structured_table', split='test') data_point = test_data[0] image, gt_table = ( bytes_to_image(data_point["images"]), parse_annotations(data_point["annotation"]), )




