text-dense-unified
收藏资源简介:
# textdense_unified 将两个文本密集型图像数据集合并为单一 parquet 语料库。二者原先的目录结构与元数据字段互不兼容: | 来源 | 行数 | 原始位置 | |---|---:|---| | `filter_dataset` | 48,794 | `/nfs_yaoyuan/liuxinyu/zijun/filter_dataset.zip`(散装 PNG/JPG + 每图一个 JSON) | | `ScreenParse_v2` | 730,578 | `/nfs_yaoyuan/liuxinyu/screenparse_dense/`(ScreenParse v2 train 经密度过滤后的约 50%) | **779,372 行 / 308 个 parquet 文件 / 503.3 GB** —— 与源数据的 503.5 GB 相差 0.0%,因为图像是逐字节原样拷贝的。 由 `merge_textdense.py` 构建(3.16 小时,162 个任务单元,48 个 worker,无错误),并由 `validate_textdense.py` 校验,两个脚本都在 `/cephfs/liuxinyu/`。图像数据与源文件 **逐字节一致**,没有任何重新编码,因此本次合并对所保留的字段而言是无损重打包。 ## Schema ``` uid string "{source_dataset}/{orig_id}",全局唯一 source_dataset string 取值见下 image struct<bytes: binary, path: string> HF Image feature width int32 与解码后的实际像素尺寸一致(已校验) height int32 ocr_text string 阅读顺序的 OCR 文本,两个语料库都有 ocr_engine string 格式判别字段,注意事项见下 ocr_raw string 逐行检测结果 JSON;filter_dataset 的行为 NULL ``` `source_dataset` 取值:`WebSight_sample50k`、`paper2fig_sample50k`、`DocVQA`、 `StructVis_sample50k`、`InfographicVQA`、`StructVisual_sample50k`、`POSTA_text`、 `DiagramGen`、`POSTA_design`、`ScreenParse_v2`。



