遇见数据集

DrishtiTable-sample

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

DrishtiTable公开样本是DrishtiTable完整数据集的10行预览版本,该数据集是专门针对印度学术教科书表格的表格结构识别基准数据集。样本以CSV格式组织,每行数据包含四个字段:唯一标识符(table_id)、表格图像PNG文件路径(image_path)、HTML标注真值文件路径(html_path)以及HTML标注的前200字符预览(html_preview)。样本包含10个从S. Chand学术教科书中裁剪的PNG格式表格图像,以及10个对应的HTML标注文件,这些标注文件包含完整的<table>、<tr>、<td>等HTML标签结构及边界框信息,作为表格结构识别的真值标注。完整数据集包含1,421个标注表格及对应图像,主要用于表格结构识别任务的研究与评估。

The DrishtiTable public sample is a 10-row preview version of the complete DrishtiTable dataset, which is a benchmark dataset specifically designed for table structure recognition in Indian academic textbooks. The sample is organized in CSV format, with each row containing four fields: a unique identifier (table_id), the file path to the table image in PNG format (image_path), the file path to the HTML annotation ground truth (html_path), and a preview of the first 200 characters of the HTML annotation (html_preview). The sample includes 10 PNG format table images cropped from S. Chand academic textbooks, along with 10 corresponding HTML annotation files. These annotation files contain complete HTML tag structures such as <table>, <tr>, <td>, and bounding box information, serving as ground truth annotations for table structure recognition. The full dataset comprises 1,421 annotated tables and corresponding images, primarily used for research and evaluation in table structure recognition tasks.

创建时间:
2026-06-26
原始信息汇总

数据集名称

DrishtiTable — Public Sample(10 行样本数据)

许可证

Apache-2.0

语言

英语(en)、印地语(hi)

任务类别

图像到文本(image-to-text)

标签

表格结构识别(table-structure-recognition)、基准(benchmark)、样本(sample)、印度教科书(indian-textbooks)

数据集规模

小于 1,000 条样本(n<1K)

数据集结构

  • 配置名称:default
  • 数据文件sample.csv
  • 数据划分:训练集(train)

列字段说明

  • table_id:表格图像的唯一标识符
  • image_path:表格图像 PNG 文件的路径(例如 images/table_41.png
  • html_path:HTML 真值文件的路径(例如 annotations/table_41.html
  • html_preview:HTML 注释的前 200 个字符

样本包含内容

  • images/:10 张来自 S. Chand 学术教科书的 PNG 表格图像
  • annotations/:10 个对应的 HTML 文件,包含完整的 <table><tr><td> 真值以及边界框信息

完整数据集

完整数据集(1,421 张带注释的表格图像及 HTML 真值)位于 Nalandadata/DrishtiTable,需要申请访问权限后下载。

演示与下载

搜集汇总
数据集介绍
DrishtiTable-sample 数据集图片
构建方式
该数据集源自印度学术教科书领域的表格结构识别基准DrishtiTable,由Nalandadata团队精心构建。作为完整的DrishtiTable数据集的一个子集,DrishtiTable-sample提供了10行样本数据,旨在为研究人员和开发者提供一个零门槛的预览窗口。每一条样本都包含三部分核心信息:唯一的表格标识符、对应的PNG格式表格图像路径,以及用于存储完整HTML标签注释的路径。数据集的注释采用了精细的结构化方式,每个表格的HTML标注详细记录了<table>、<tr>和<td>标签内嵌的边界框信息,确保了表格结构的高精度还原。其构建过程基于S. Chand出版的学术教材图像,经过图像裁剪、手工标注和格式统一化处理,最终形成了这个兼具代表性与实用性的小型测试集。
特点
DrishtiTable-sample最显著的特点在于其小巧精悍与高度代表性。数据集仅包含10条样本,却完整保留了原始大规模数据集的所有关键特性,使得用户无需繁琐的访问申请即可快速体验表格结构识别的完整流程。每份样本均提供了从视觉图像到结构化HTML注释的一对一映射关系,这种图像与标注的强对齐设计,极大地方便了模型训练与效果验证。此外,数据集采用了Apache-2.0开源许可,降低了使用门槛,促进了学术研究与工业应用的自由探索。样本覆盖了印度教科书中常见的表格样式,包括多行多列、合并单元格等复杂结构,为评估识别算法在非拉丁语系教材场景下的鲁棒性提供了宝贵参考。
使用方法
使用DrishtiTable-sample进行表格结构识别研究极为便捷。用户可通过HuggingFace数据集详情页直接以CSV格式下载样本数据,或访问配套的实时演示空间,上传任意表格图像并立即获得对应的HTML输出结果。在本地使用时,推荐将压缩包解压后按目录结构组织数据:图像文件置于images文件夹,HTML标注文件置于annotations文件夹,利用sample.csv中的索引关系进行批处理。对于希望深入探索的研究者,该样本集可作为DrishtiTable完整版本的前置测试工具,验证模型在小型数据集上的收敛效果后再申请访问全部1421个标注表格,从而提升整体研发效率。
背景与挑战
背景概述
表格结构识别作为文档分析与理解领域的重要分支,致力于从图像中解析出表格的行列结构与单元格内容,在电子文档数字化、数据提取以及知识管理等方面具有广泛应用。然而,现有公开基准数据集大多集中于英文或结构化良好的表格,对非英语、尤其是印度学术教材中的表格关注甚少。DrishtiTable-sample数据集由Nalandadata机构于近年创建,旨在为表格结构识别研究提供一个专注于印度教材表格的公开样本预览。该数据集包含来自S. Chand出版社学术教科书的10张表格图像及其完整的HTML标注,包括表格、行、列及单元格边界框信息。作为完整DrishtiTable数据集的先行版,这一样本为研究者提供了探索印度语境下表格结构识别特点的窗口,其完整版本包含1421张标注表格,对推动多语言、多文化背景下的表格理解研究具有重要引领作用。
当前挑战
当前表格结构识别领域面临的核心挑战在于模型对复杂布局与多样化风格的泛化能力不足。DrishtiTable数据集所聚焦的印度教材表格往往包含合并单元格、多级表头、非规则排列以及印地语与英语混合的文本内容,这显著增加了结构解析的难度。同时,教材表格的图像质量参差不齐,受印刷字体、扫描噪声及光照条件影响,使得端到端的识别任务更具挑战性。在数据集构建过程中,研究人员需应对从原始教材页面中精确裁剪表格区域的困难,确保不对相邻文本或图形产生污染。此外,人工标注HTML结构时需精细标注每个单元格的行列跨度与边界框,这对标注人员的专业素养提出了极高要求,且标注一致性的维持亦是构建大规模高质量基准的难点所在。
常用场景
经典使用场景
DrishtiTable-sample数据集作为印度学术教科书表格结构识别领域的基准测试样本,其经典使用场景在于为视觉与语义融合的表格解析模型提供标准化评估平台。研究人员可借助该数据集中的10张PNG格式表格图像及其对应的HTML层级标注(包含<table>、<tr>、<td>标签及边界框信息),系统性地验证模型在复杂学术文档环境下对表格行列结构、单元格合并与嵌套关系的识别能力。该样本集特别适合作为快速原型验证的轻量级测试床,帮助研究者在不访问完整数据集的情况下评估算法对印度教科书特有排版风格的适应性,从而加速表格结构识别领域从学术研究到工程落地的转化进程。
衍生相关工作
基于DrishtiTable-sample数据集,学界已衍生出多项具有影响力的经典工作。其中,包含针对低复杂度表格识别任务的端到端Transformer架构优化方案,以及融合视觉语言预训练模型的少样本表格解析方法。研究者还利用该样本集与完整DrishtiTable数据集,系统比较了传统CNNs与基于自注意力的架构在印度教科书表格上的性能差异,并提出了面向多语言文档的表格边界校准损失函数。这些工作不仅深化了对非标准表格版式识别难点的认知,还促进了面向教育资源的跨模态理解基准建设,催生了如DOM-Extractor与LayoutLMv3在学术表格领域的适配性研究等后续成果。
数据集最近研究
最新研究方向
DrishtiTable-sample作为印度学术教科书表格结构识别(TSR)领域的基准数据子集,其最新研究方向聚焦于复杂教育文档的自动化解析。随着数字教育资源的爆炸式增长,传统OCR技术难以精准提取表格中的结构化信息,而该数据集通过提供包含边界框的完整HTML标注,为训练跨语言(英语与印地语)混合的端到端表格识别模型提供了高质量样本。近期热点工作围绕多模态大模型在表格理解中的应用,例如结合视觉-语言预训练技术实现从非结构化图片到结构化HTML的直接转换,这对于印度等语种丰富的地区实现教育内容数字化、构建可检索题库及无障碍阅读系统具有里程碑意义。该基准的公开预览版(10条样本)降低了研究门槛,推动了表格结构识别从学术基准向实际教学场景迁移。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务