stanford-crfm/i2s-latex
收藏官方服务:
资源简介:
Image2Struct是一个用于评估视觉语言模型从图像中提取结构化信息能力的基准数据集。该子数据集专注于LaTeX代码,模型被给定一个预期输出的图像,并提示生成用于生成该图像的LaTeX代码。数据集分为五个类别:方程、表格、算法、代码和野生类别,其中前四个类别是通过Image2Struct仓库自动收集的,而野生类别是通过截取维基百科页面上的方程图像收集的。数据集的主题涵盖了ArXiv上的多个学科,包括电子工程、计算机科学、统计学、数学、物理学、经济学、生物学和金融学。
Image2Struct是一个用于评估视觉语言模型从图像中提取结构化信息能力的基准数据集。该子数据集专注于LaTeX代码,模型被给定一个预期输出的图像,并提示生成用于生成该图像的LaTeX代码。数据集分为五个类别:方程、表格、算法、代码和野生类别,其中前四个类别是通过Image2Struct仓库自动收集的,而野生类别是通过截取维基百科页面上的方程图像收集的。数据集的主题涵盖了ArXiv上的多个学科,包括电子工程、计算机科学、统计学、数学、物理学、经济学、生物学和金融学。
提供机构:
stanford-crfm原始信息汇总
数据集概述
基本信息
- 数据集名称: Image2Structure - Latex
- 任务类别:
- 问答(question-answering)
- 视觉问答(visual-question-answering)
- 数据集大小:
- 算法配置: 35687268.0 字节
- 方程配置: 6048536.0 字节
- 图配置: 12245318.0 字节
- 真实配置: 496779.0 字节
- 表格配置: 30860645.0 字节
- 下载大小:
- 算法配置: 33800484 字节
- 方程配置: 4696512 字节
- 图配置: 8209981 字节
- 真实配置: 496792 字节
- 表格配置: 29140278 字节
- 验证集示例数量: 每个配置均为300个示例
特征描述
-
通用特征:
structure: 字符串类型text: 字符串类型image: 图像类型download_url: 字符串类型instance_name: 字符串类型date: 字符串类型additional_info: 字符串类型date_scrapped: 字符串类型file_filters: 字符串类型compilation_info: 字符串类型rendering_filters: 字符串类型assets: 字符串序列类型category: 字符串类型uuid: 字符串类型length: 字符串类型difficulty: 字符串类型
-
特定配置特征:
- 真实配置:
url: 字符串类型
- 真实配置:
数据集结构
- 配置名称:
- 算法
- 方程
- 图
- 真实
- 表格
- 数据文件路径:
- 算法:
algorithm/validation-* - 方程:
equation/validation-* - 图:
plot/validation-* - 真实:
real/validation-* - 表格:
table/validation-*
- 算法:
应用领域
- 生物学
- 金融
- 经济学
- 数学
- 物理学
- 计算机科学
- 电子学
- 统计学
数据集用途
- 评估多模态模型学习文档结构的能力,特别是LaTeX代码的生成。模型接收预期输出的图像,并要求提供生成该图像的LaTeX代码。
搜集汇总
数据集介绍

以上内容由遇见数据集搜集并总结生成



