SciIR-82k
收藏资源简介:
SciIR-82k是一个用于科学图像推理生成的大规模数据集,包含超过80,000个高质量的科学图文对。该数据集旨在为需要生成科学上可信(而非仅视觉上合理)视觉内容的文生图模型提供训练和评估支持,其核心目标是提供面向过程的监督,帮助模型学习科学图像背后的视觉逻辑、科学结构、因果过程和领域约束。所有数据样本均源自Nature和Nature Communications期刊中采用CC BY 4.0许可的开放获取文章,并保留了文章标题、URL、图注、许可信息等完整的溯源元数据,以确保可追溯性和负责任的重用。数据集围绕受符号学分类启发的三个科学推理维度进行组织:1) 实体结构:科学实体之间的空间、拓扑、组成或层次关系;2) 科学过程:因果、时间、程序、实验或机制关系;3) 科学定律:必须遵守的抽象科学原理、物理约束、化学规则、生物机制或领域特定定律。每个数据样本关联一个处理后的科学图像、一个结构化推理标注、一个详细的科学推理思维链(sci-RCoT)标题、一个简洁的科学摘要提示词以及从原始文章提取的源元数据。数据集文件结构包括存储图像的`images/`目录、包含主要推理和提示词标注的`caption.json`文件,以及包含源端溯源、原始文本上下文、图像信息和许可信息的`metadata.json`文件,三者通过共享的`image_id`字段进行关联。SciIR-82k适用于科学文生图、推理感知图像生成、科学图表合成、多模态科学推理、提示词到图表生成、生成图像的科学正确性评估等研究,并强调在遵循原始CC BY 4.0许可条款、保留适当归属的前提下进行负责任的使用。
数据集概述
SciIR-82k 是一个大规模的科学图像推理生成数据集,旨在支持文本到图像模型的训练与评估,模型需要生成科学上忠实于事实的视觉内容,而非仅视觉上合理的插图。
核心特点
- 规模:包含超过 80,000 对高质量科学图像与文本。
- 来源:所有样本均来自 Nature 和 Nature Communications 期刊中采用 CC BY 4.0 许可的开放获取文章。
- 导向:提供过程导向的监督,帮助模型学习科学图形背后的视觉逻辑、科学结构、因果过程和领域约束。
数据组织与结构
数据集围绕三个推理维度构建,受符号学分类启发:
- 实体结构 (Entity Structure):科学实体之间的空间、拓扑、组成或层次关系。
- 科学过程 (Scientific Process):因果、时间、程序、实验或机制关系。
- 科学定律 (Scientific Law):必须遵循的抽象科学原理、物理约束、化学规则、生物机制或领域特定定律。
目录结构
text SciIR-82k/ ├── images/ # 处理后的科学图像/子图 ├── caption.json # 推理与提示注释 ├── metadata.json # 来源溯源与额外元数据 └── README.md
文件说明
- images/:包含从原始文章中提取并处理后的科学图形文件,每个图像通过
image_id与其余文件关联。 - caption.json:
- 主要包含由标注流水线生成的推理和提示注释。
- 每个条目包含:
image_id:唯一标识符。reasoning:按推理维度组织的结构化注释(包含ScientificLaw、EntityStructure、ScientificProcess,每个维度有对齐的terms和visualization列表)。sci-RCoT:详细科学推理思维链标题,描述视觉逻辑、实体、空间关系、因果过程和领域约束。science_abstract_prompt:从推理注释中提炼的简洁科学抽象提示。
- metadata.json:
- 包含源侧溯源信息、原始文本上下文、图形信息、许可信息及额外注释。
- 每个条目除了包含
caption.json中的字段外,还包括:article_title、article_abstract、article_body、source_citation、figure_title、figure_caption、figure_index。image_url、source_article_url、figure_page_url。license、license_url。segments:处理后的图形分段信息。Keywords、subject。
关键关系
三个主要组件通过 image_id 关联:
text images/<image_id>.<ext> caption.json entry (相同 image_id) metadata.json entry (相同 image_id)
数据集可视为对齐记录的集合:
text 处理后的科学图像 + 结构化推理注释 + 详细 Sci-RCoT 标题 + 简洁科学抽象提示 + 源文章元数据
标注流水线
- 语料收集:从 Nature 和 Nature Communications 收集 CC BY 4.0 许可的开放获取文章。
- 图形处理:提取原始图形,将多面板图形分解为语义独立的子图。
- 符号分类:根据科学推理维度(实体结构、科学过程、科学定律)对每个样本分类。
- 推理驱动标注:逆向工程每个科学图像背后的视觉推理,提取术语和可视化描述,合成思维链标题,并提炼出抽象提示。
预期用途
- 科学文本到图像生成
- 推理感知图像生成
- 科学图形合成
- 多模态科学推理
- 提示到图示生成
- 生成图像的科学正确性评估
- 微调文本到图像模型
- 分析生成科学图像中的实体结构、科学过程和科学定律
许可与归属
所有样本仅来自采用 CC BY 4.0 许可的开放获取文章。数据集包含来源引用、文章 URL、许可 URL 等溯源元数据。用户需遵循原始许可条款,并保留对原作者和出版物的适当归属。
伦理与负责任使用
- 不应将生成图像视为经过验证的科学证据。
- 模型可能仍会生成错误的科学结构或关系。
- 建议由领域专家验证生成的科学图像。
- 清楚区分生成图像与真实实验结果。
- 遵循原始文章的许可条款。




