table-understanding-dataset|表格理解数据集|算法评估数据集
收藏数据集概述
扫描图像数据集
- UW数据集: 由I. T. Phillips在1996年发布,具体内容未详述。
- UNLV数据集: 已不可用,可通过web.archive.org访问历史存档。
原生PDF数据集
- PDF-TREX系统: 包含多数意大利财务表格,但未提供ground-truth信息。
- ICDAR 2013 Table Competition数据集: 包含59个PDF文件,总计117个表格,分为EU和US两个子集,源自欧洲和美国政府网站的公共领域文档。数据集提供ground-truth信息,并可能在未来进行扩展。
其他相关数据集
- 计算机科学会议数据集: 包含150篇论文,共458个图表和190个表格,通过LabelMe工具进行手动标注,提供详细的ground-truth信息。
- Page Object Detection (POD)数据集: 包含超过2000张图像,用于检测文档图像中的特定页面对象(如表格、公式、图表等)。

中国交通事故深度调查(CIDAS)数据集
交通事故深度调查数据通过采用科学系统方法现场调查中国道路上实际发生交通事故相关的道路环境、道路交通行为、车辆损坏、人员损伤信息,以探究碰撞事故中车损和人伤机理。目前已积累深度调查事故10000余例,单个案例信息包含人、车 、路和环境多维信息组成的3000多个字段。该数据集可作为深入分析中国道路交通事故工况特征,探索事故预防和损伤防护措施的关键数据源,为制定汽车安全法规和标准、完善汽车测评试验规程、
北方大数据交易中心 收录
中国农村金融统计数据
该数据集包含了中国农村金融的统计信息,涵盖了农村金融机构的数量、贷款余额、存款余额、金融服务覆盖率等关键指标。数据按年度和地区分类,提供了详细的农村金融发展状况。
www.pbc.gov.cn 收录
UAVDT
UAVDT是一个用于目标检测任务的数据集。
github 收录
Med-MAT
Med-MAT是一个包含106个开源医学数据集的视觉问答(VQA)数据集,旨在推动医学多模态大语言模型(MLLMs)的泛化实验和训练。数据集通过将图像-标签对转换为VQA格式,展示了组合泛化(CG)是MLLMs理解未见图像的关键机制。数据集包括106个医学数据集的问答对、53个按模态、解剖区域和任务(MAT)分类的子集的问答对,以及部分数据集的图像下载链接。
huggingface 收录
AISHELL/AISHELL-1
Aishell是一个开源的中文普通话语音语料库,由北京壳壳科技有限公司发布。数据集包含了来自中国不同口音地区的400人的录音,录音在安静的室内环境中使用高保真麦克风进行,并下采样至16kHz。通过专业的语音标注和严格的质量检查,手动转录的准确率超过95%。该数据集免费供学术使用,旨在为语音识别领域的新研究人员提供适量的数据。
hugging_face 收录