RevX_OCR_results
收藏资源简介:
本数据集名为Revolution Crossroads OCR Results,是基于视觉语言模型(VLM)技术对三个原始数据集进行光学字符识别(OCR)处理后的结果,以表格格式提供。数据集包含两种级别的OCR数据:chunk-level(块级)和page-level(页级),分别对应两个独立的Parquet文件,均标记为训练集(train分割)。其中,chunk-level配置为默认配置。该数据集适用于需要结构化OCR结果的文本分析、信息提取或机器学习任务。
This dataset, named Revolution Crossroads OCR Results, is the result of optical character recognition (OCR) processing on three original datasets based on visual language model (VLM) technology, provided in table format. The dataset contains two levels of OCR data: chunk-level and page-level, corresponding to two independent Parquet files, both labeled as training sets (train split). Among them, chunk-level is configured as the default. This dataset is suitable for text analysis, information extraction, or machine learning tasks that require structured OCR results.




