遇见数据集

SciIR-82k

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

SciIR-82k是一个用于科学图像推理生成的大规模数据集,包含超过80,000个高质量的科学图文对。该数据集旨在为需要生成科学上可信(而非仅视觉上合理)视觉内容的文生图模型提供训练和评估支持,其核心目标是提供面向过程的监督,帮助模型学习科学图像背后的视觉逻辑、科学结构、因果过程和领域约束。所有数据样本均源自Nature和Nature Communications期刊中采用CC BY 4.0许可的开放获取文章,并保留了文章标题、URL、图注、许可信息等完整的溯源元数据,以确保可追溯性和负责任的重用。数据集围绕受符号学分类启发的三个科学推理维度进行组织:1) 实体结构:科学实体之间的空间、拓扑、组成或层次关系;2) 科学过程:因果、时间、程序、实验或机制关系;3) 科学定律:必须遵守的抽象科学原理、物理约束、化学规则、生物机制或领域特定定律。每个数据样本关联一个处理后的科学图像、一个结构化推理标注、一个详细的科学推理思维链(sci-RCoT)标题、一个简洁的科学摘要提示词以及从原始文章提取的源元数据。数据集文件结构包括存储图像的`images/`目录、包含主要推理和提示词标注的`caption.json`文件,以及包含源端溯源、原始文本上下文、图像信息和许可信息的`metadata.json`文件,三者通过共享的`image_id`字段进行关联。SciIR-82k适用于科学文生图、推理感知图像生成、科学图表合成、多模态科学推理、提示词到图表生成、生成图像的科学正确性评估等研究,并强调在遵循原始CC BY 4.0许可条款、保留适当归属的前提下进行负责任的使用。

创建时间:
2026-06-20
原始信息汇总

数据集概述

SciIR-82k 是一个大规模的科学图像推理生成数据集,旨在支持文本到图像模型的训练与评估,模型需要生成科学上忠实于事实的视觉内容,而非仅视觉上合理的插图。

核心特点

  • 规模:包含超过 80,000 对高质量科学图像与文本。
  • 来源:所有样本均来自 Nature 和 Nature Communications 期刊中采用 CC BY 4.0 许可的开放获取文章。
  • 导向:提供过程导向的监督,帮助模型学习科学图形背后的视觉逻辑、科学结构、因果过程和领域约束。

数据组织与结构

数据集围绕三个推理维度构建,受符号学分类启发:

  • 实体结构 (Entity Structure):科学实体之间的空间、拓扑、组成或层次关系。
  • 科学过程 (Scientific Process):因果、时间、程序、实验或机制关系。
  • 科学定律 (Scientific Law):必须遵循的抽象科学原理、物理约束、化学规则、生物机制或领域特定定律。

目录结构

text SciIR-82k/ ├── images/ # 处理后的科学图像/子图 ├── caption.json # 推理与提示注释 ├── metadata.json # 来源溯源与额外元数据 └── README.md

文件说明

  • images/:包含从原始文章中提取并处理后的科学图形文件,每个图像通过 image_id 与其余文件关联。
  • caption.json
    • 主要包含由标注流水线生成的推理和提示注释。
    • 每个条目包含:
      • image_id:唯一标识符。
      • reasoning:按推理维度组织的结构化注释(包含 ScientificLawEntityStructureScientificProcess,每个维度有对齐的 termsvisualization 列表)。
      • sci-RCoT:详细科学推理思维链标题,描述视觉逻辑、实体、空间关系、因果过程和领域约束。
      • science_abstract_prompt:从推理注释中提炼的简洁科学抽象提示。
  • metadata.json
    • 包含源侧溯源信息、原始文本上下文、图形信息、许可信息及额外注释。
    • 每个条目除了包含 caption.json 中的字段外,还包括:
      • article_titlearticle_abstractarticle_bodysource_citationfigure_titlefigure_captionfigure_index
      • image_urlsource_article_urlfigure_page_url
      • licenselicense_url
      • segments:处理后的图形分段信息。
      • Keywordssubject

关键关系

三个主要组件通过 image_id 关联:

text images/<image_id>.<ext> caption.json entry (相同 image_id) metadata.json entry (相同 image_id)

数据集可视为对齐记录的集合:

text 处理后的科学图像 + 结构化推理注释 + 详细 Sci-RCoT 标题 + 简洁科学抽象提示 + 源文章元数据

标注流水线

  1. 语料收集:从 Nature 和 Nature Communications 收集 CC BY 4.0 许可的开放获取文章。
  2. 图形处理:提取原始图形,将多面板图形分解为语义独立的子图。
  3. 符号分类:根据科学推理维度(实体结构、科学过程、科学定律)对每个样本分类。
  4. 推理驱动标注:逆向工程每个科学图像背后的视觉推理,提取术语和可视化描述,合成思维链标题,并提炼出抽象提示。

预期用途

  • 科学文本到图像生成
  • 推理感知图像生成
  • 科学图形合成
  • 多模态科学推理
  • 提示到图示生成
  • 生成图像的科学正确性评估
  • 微调文本到图像模型
  • 分析生成科学图像中的实体结构、科学过程和科学定律

许可与归属

所有样本仅来自采用 CC BY 4.0 许可的开放获取文章。数据集包含来源引用、文章 URL、许可 URL 等溯源元数据。用户需遵循原始许可条款,并保留对原作者和出版物的适当归属。

伦理与负责任使用

  • 不应将生成图像视为经过验证的科学证据。
  • 模型可能仍会生成错误的科学结构或关系。
  • 建议由领域专家验证生成的科学图像。
  • 清楚区分生成图像与真实实验结果。
  • 遵循原始文章的许可条款。
搜集汇总
数据集介绍
SciIR-82k 数据集图片
构建方式
SciIR-82k的构建始于从Nature及Nature Communications期刊中采集遵循CC BY 4.0许可的开放获取论文。原始图表被提取后,多面板图被拆解为语义独立的子图。随后,每一样本依据符号学分类法,从实体结构、科学过程和科学定律三个推理维度进行分层标注。标注管道逆向解析了科学图像背后的视觉推理,提取了视觉化的科学术语及其对应描述,生成了详细的科学推理思维链描述,并进一步提炼出简洁的科学抽象提示。这种设计使得图像、结构化推理、详细描述与抽象提示形成对齐的监督信号,为模型提供了过程导向的指导。
特点
该数据集的核心特色在于其推理驱动的标注架构。与传统仅关注视觉真实感的图文对不同,SciIR-82k强调科学图像的逻辑性、结构性和领域约束。每个样本均包含结构化推理标注,明确了实体间的空间与层级关系、科学过程中的因果与时间序列,以及必须遵守的科学定律与物理约束。科学推理思维链描述详细阐述了图像的视觉逻辑,而科学抽象提示则为生成任务提供了简洁输入。数据集规模超过八万对,来源权威且可追溯,支持模型从视觉外观深入到科学的本质逻辑。
使用方法
使用时,用户需读取caption.json和metadata.json文件,并通过统一的image_id与images目录中的图像文件关联。caption.json提供了结构化推理、科学推理思维链及抽象提示,适用于训练推理感知的文本到图像生成模型。metadata.json则包含源文章标题、摘要、主体文本、图表原始标题及许可信息,便于数据的追溯与复现。上述组件可通过Python的json和PIL库简单加载,用户可根据研究需求灵活选用科学抽象提示作为生成输入,或利用详细的推理链进行指令跟随训练。
背景与挑战
背景概述
科学图像生成是人工智能领域中一个极具挑战性的研究方向,其目标不仅在于生成视觉上合理的图像,更在于确保图像内容严格遵循科学事实与内在逻辑。现有文本到图像模型大多依赖自然场景数据,缺乏对科学实体结构、过程机制及定律约束的显式建模能力。为填补这一空白,SciIR-82k数据集于近期由研究团队构建,数据源自Nature及其子刊中CC BY 4.0许可的开放获取文章。该数据集围绕三个推理维度——实体结构、科学过程与科学定律——组织超过8万对高质量图像-文本对,并提供结构化的推理标注与科学思维链描述,旨在为模型提供过程导向的监督信号,推动科学图像生成从外观驱动向推理驱动转变。
当前挑战
该数据集面临的核心挑战包括:1)领域问题层面,现有模型难以在生成科学图像时兼顾实体间空间拓扑、因果时序过程及抽象科学定律的忠实呈现,常出现违反物理约束或生物机理的错误;2)构建过程层面,从开放获取文章中自动提取并分解多面板科学图表时,需确保子图语义独立性与标注一致性,跨文章领域术语与视觉描述的映射关系复杂;3)推理标注的逆向工程难度大,需将隐性的科学逻辑显式化为可学习的结构化注解,同时保证链式思维描述与简洁提示之间的信息无损压缩。
常用场景
经典使用场景
在科学图像生成领域,SciIR-82k数据集凭借其超过八万对的高质量科学图像-文本配对,成为训练和评估科学文本到图像生成模型的核心基准。该数据集独特之处在于其包含了结构化推理标注、详细的科学推理思维链描述以及简洁的科学摘要提示,为模型提供了从视觉逻辑、科学实体空间关系到因果机制的多维过程监督。研究者常利用此数据集探究如何让生成模型不仅复现科学图形的外观,更能忠实地遵循其背后的科学结构、领域约束和因果过程,从而推动科学图表、示意图等视觉内容的生成质量跃升至新的高度。
解决学术问题
该数据集直接回应了科学图像生成中长期存在的核心难题——视觉忠实性与科学正确性之间的鸿沟。传统文本到图像模型容易生成视觉合理但科学谬误的内容,SciIR-82k通过引入实体结构、科学过程和科学法则三个推理维度,为模型提供可量化的科学可信度评估依据。它解决了如何自动生成符合物理、化学、生物等学科规律的科学插图这一关键学术问题,并将生成任务从简单的视觉映射提升为推理感知过程,为多模态科学推理、科学图形合成与评估等研究方向奠定了数据基础,其意义在于弥合了人工智能生成内容与真实科学知识之间的信任鸿沟。
衍生相关工作
基于SciIR-82k衍生出的经典工作主要集中在推理驱动与科学约束生成两大方向。研究者提出了科学推理链引导的图文生成框架,将数据集中的结构化推理标注作为中间监督信号,显著提升了生成图像在实体空间关系与因果流程上的正确率。另一批工作探讨了科学法则嵌入的生成对抗网络,利用数据集的科学法则标注项设计物理约束损失函数,使模型能自动规避生成违反基本科学原理的视觉内容。此外,该数据集还催生了科学图像忠实性评估基准,通过对比生成图中实体结构与数据集中标注的三维推理维度,建立了一套量化科学正确性的评价指标体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务