遇见数据集

SciIR-82k

收藏
github2026-06-30 更新2026-07-03 收录
官方服务:

资源简介:

SciIR-82k是一个大规模精炼数据集,包含超过80,000个来自《自然》和《自然通讯》的高质量科学图像-文本对,并增强了科学推理思维链(Sci-RCoT)注释,以明确形式化潜在的视觉推理路径。该数据集根据符号学维度分层组织,用于科学图像生成的训练和评估。

SciIR-82k is a large-scale refined dataset containing over 80,000 high-quality scientific image-text pairs sourced from *Nature* and *Nature Communications*. It additionally includes Scientific Reasoning Chain of Thought (Sci-RCoT) annotations that explicitly formalize the latent visual reasoning pathways. This dataset is hierarchically organized based on semiotic dimensions for the training and evaluation of scientific image generation.

创建时间:
2026-06-23
原始信息汇总

SciIR:科学图像推理生成的大规模训练数据集与基准

概述

SciIR(Scientific Image Reasoning)是一个专注于科学图像生成推理能力的综合资源,被 ECCV 2026 收录。项目受皮尔斯符号学三元组理论启发,系统性地构建了训练数据、评估基准和基线模型。

核心贡献

  • 理论驱动的分类体系:基于皮尔斯符号学三元组,将科学正确性分解为三个可验证维度
  • SciIR-82k 数据集:超过 80,000 个高质量科学图像-文本对
  • SciIR-Bench 基准:首个系统性分类评估科学图像生成推理能力的基准
  • Qwen-Image-SciIR 模型:在 SciIR-Bench 上将最终评分从 35% 提升至 43%

数据来源与构建

数据来源

  • 来源期刊:NatureNature Communications
  • 许可协议:CC BY 4.0 开放获取文章

构建流程(三阶段自动流水线)

阶段 操作 方法
1. 语料构建 多面板图形分解 YOLO11 文档布局分析
标准化处理 边缘填充至 1024×1024
质量筛选 InternVL3.5 两级 VLM 过滤
2. 符号学分层 三轨道相关性评分 Qwen3-VL 评估
3. 推理驱动标注 逻辑逆向工程 Qwen3-VL(视觉定位)+ Qwen3-Max(语义抽象)

数据集格式

SciIR-82k(Hugging Face 地址)

  • 80K+ 高质量科学图像-文本对
  • 包含 Sci-RCoT(科学推理思维链)标注
  • 提供短文本和长文本两种形式

数据分层(三核心维度)

  • 实体结构(Icon):标注实体的正确渲染
  • 科学过程(Index):空间与拓扑关系、多阶段过程
  • 科学定律(Symbol):逻辑一致性与科学规律

SciIR-Bench 评估基准

基准特点

  • 超越传统整体图像质量评估指标
  • 四个评估组(每组 200 个样本):全三轨整体组 + 三个两两交叉组
  • 每个样本分为 指令遵循(IF)内在推理(IR) 两个难度层级

评估方法:原子清单

  • 三阶段自动化评估协议:真实标注提取 → 原子问题生成 → 基于证据的裁判
  • 评估模型:Gemini-3-Pro
  • 严格样本级否决机制惩罚幻觉

Qwen-Image-SciIR 基线模型

模型架构

  • 推理规划器:Qwen2.5-7B-Instruct(LoRA 微调,r=64, α=16),从提示词推断 Sci-RCoT
  • 视觉生成器:Qwen-Image-2512(LoRA 微调,r=32),在 1024×1024 分辨率合成图像

性能提升

  • 最终评分从 35% → 43%
  • 科学过程维度提升 +16%
  • 实体结构维度提升 +9%

引用

@misc{ma2026sciirlargescaletrainingdataset, title={SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation}, author={Zhiyuan Ma and Zhengfeng Shi and Yuning An and Peize Li and Jiabao Wei and Ruijie Li and Junhao Xiao and Jianjun Li and Bowen Zhou}, year={2026}, eprint={2606.30124}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2606.30124} }

许可

  • 数据集代码:供学术研究使用
  • SciIR-82k 数据集来源:NatureNature Communications 的 CC BY 4.0 开放获取文章
  • 整体协议:CC BY 4.0
搜集汇总
数据集介绍
SciIR-82k 数据集图片
构建方式
面对科学图像生成中语义对齐与逻辑推理的严峻挑战,SciIR-82k数据集基于皮尔斯符号学三元组理论,从Nature与Nature Communications的开放获取论文中系统性地构建而成。其构建流程划分为三个精密阶段:首先通过YOLO11模型对多面板图表进行子图分解,并标准化至1024×1024分辨率,随后利用InternVL3.5执行两阶段VLM过滤以保留有效示意图;其次,借助Qwen3-VL对每一样本在实体结构、科学过程与科学定律三个符号学维度上的相关性进行评分,从而实现面向目标标注管道的智能路由;最终,通过逻辑逆向工程,由Qwen3-VL完成视觉定位、Qwen3-Max实现语义抽象,重构出蕴含潜在视觉逻辑的科学推理思维链(Sci-RCoT),并蒸馏为简洁而信息完备的提示。
特点
SciIR-82k数据集拥有超过八万对高质量的科学图像与文本配对,其核心特点在于构建于符号学三元组的系统性分类体系之上。数据集将科学正确性分解为实体结构、科学过程和科学定律三个可验证维度,并创新性地引入科学推理思维链(Sci-RCoT)作为过程导向的监督信号,显式地建模了视觉生成背后的逻辑推理路径,这使其显著区别于仅提供结果导向监督的既有数据集。此外,数据集组织层次分明,每一阶段均基于多模态大模型的自动化流程严格把控科学保真度,为科学图像生成任务提供了精细化的训练基础。
使用方法
用户可通过Hugging Face平台直接获取并加载SciIR-82k数据集。数据集附带完整的开源构建与评测脚本,存放于GitHub仓库的code/dataset&benchmark目录下。对于训练,用户可依据提供的流水线脚本复现从语料构建、符号学分层的完整流程,或直接使用整理好的图文对及其Sci-RCoT标注进行模型微调。具体而言,可参照配套的Qwen-Image-SciIR训练方法,依次对推理规划器(Qwen2.5-7B-Instruct)与视觉生成器(Qwen-Image-2512)执行LoRA微调,并通过级联生成流程实现科学推理到视觉合成的端到端推理。评估环节则依托SciIR-Bench基准,运行候选样本选择、原子检查清单生成及自动化评分脚本,以多维度衡量模型在指令遵循与内在推理方面的科学图像生成能力。
背景与挑战
背景概述
SciIR-82k是一个由华中科技大学MAIR-Lab团队在2026年构建的大规模科学图像推理数据集,发表于ECCV 2026。该数据集旨在解决文本到图像模型在生成科学图像时面临的语义对齐与逻辑推理不足的痛点。研究团队受皮尔斯符号学三元组启发,将科学图像推理分解为实体结构、科学过程与科学定律三个可验证维度,从Nature和Nature Communications等权威期刊中收集超过8万对高质量科学图像-文本对,并引入科学推理思维链以显式建模视觉逻辑。该数据集为科学图像生成领域提供了首个大规模、多维度的训练与评测资源,有效推动了模型从感知质量向科学一致性的转型。
当前挑战
当前科学图像生成面临双重挑战。在领域问题层面,现有T2I模型虽能生成逼真视觉内容,但在示意结构准确性、多阶段过程逻辑性及科学定律遵循性上存在严重缺陷,缺乏对科学正确性的细粒度评判标准。在构建过程中,需要攻克多子图自动分解(利用YOLO11)、画布标准化至1024×1024、以及基于InternVL3.5的两阶段筛选;同时需设计基于Qwen3-VL的符号学轨道评分以路由图像至特定标注流程,并通过Qwen3-Max逆向工程还原推理链,整个过程涉及多模态模型协同与海量数据清洗,构成显著的技术壁垒。
常用场景
经典使用场景
在科学图像生成领域,现有文本到图像模型虽能生成逼真的视觉内容,却在语义对齐与逻辑推理方面表现欠佳。SciIR-82k数据集应运而生,其最经典的使用场景在于为科学图像推理生成任务提供大规模的高质量训练资源。该数据集基于皮尔斯符号学三元组理论,将科学推理形式化为实体结构、科学过程与科学定律三个核心维度,并通过科学推理链式思维显式建模潜在视觉逻辑。研究者可借助该数据集微调文本到图像模型,使其不仅掌握基础视觉元素渲染,更能精确理解并再现结构化科学内容。
实际应用
在实际应用中,SciIR-82k数据集及其对应的评估基准为多个前沿领域提供了关键支持。在科学教育与知识传播场景中,研究者可基于该数据集开发能够自动生成精确科学图解的系统,辅助教材插图制作与科学可视化;在学术出版领域,编辑与作者可利用相关模型快速生成高保真度的科研示意图,提升论文写作效率;此外,该数据集还可用于智能辅导系统的构建,帮助学生通过生成式图谱理解复杂科学概念与动态过程,从而推动科学知识的普及与深度内化。
衍生相关工作
围绕SciIR-82k数据集已衍生出一系列开创性工作。其中最引人瞩目的是Qwen-Image-SciIR模型,它将科学推理与视觉合成解耦为推理规划器与视觉生成器两个模块,通过在数据集上微调Qwen2.5-7B-Instruct与Qwen-Image-2512,在SciIR-Bench上实现了从35%到43%的显著性能提升。基于该数据集构建的SciIR-Bench评估基准,则首次从实体结构、科学过程、科学定律及文本四个轨迹系统评估科学图像生成质量,为领域研究提供了标准化评测平台,有力推动了科学图像推理生成方向的学术发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务