遇见数据集

DisciplineGen-1M

收藏
arXiv2026-07-02 更新2026-07-04 收录
数据链接:
官方服务:

资源简介:

DisciplineGen-1M是由上海交通大学等机构联合构建的百万级多学科视觉生成与编辑数据集,旨在支持知识密集型图像的文本到图像生成和图像编辑任务。该数据集包含120万个样本,覆盖数学、物理、化学、生物、地理、计算机科学、经济学、历史、音乐和体育等十个学科,数据来源融合了矢量图形渲染、OCR编辑、程序化合成和大规模过滤等多种技术,以提供结构化的图像-文本对和编辑指令。通过结合可控的语义差异和结构化标注,该数据集旨在解决生成模型在学术视觉内容中因缺乏精确推理和知识约束而导致的可靠性不足问题,推动图像生成从美学合理性向可验证的知识基础视觉创作迈进。

DisciplineGen-1M is a million-scale multi-disciplinary visual generation and editing dataset jointly constructed by Shanghai Jiao Tong University and other institutions. It is designed to support text-to-image generation and image editing tasks for knowledge-intensive images. The dataset contains 1.2 million samples covering ten disciplines including mathematics, physics, chemistry, biology, geography, computer science, economics, history, music and sports. It integrates multiple technologies such as vector graphics rendering, OCR editing, procedural synthesis and large-scale filtering to provide structured image-text pairs and editing instructions. By combining controllable semantic differences and structured annotations, this dataset addresses the problem of insufficient reliability of generative models in academic visual content caused by the lack of precise reasoning and knowledge constraints, and promotes the advancement of image generation from aesthetic plausibility to verifiable knowledge-based visual creation.

创建时间:
2026-07-02
原始信息汇总

数据集名称:DisciplineGen-1M

数据集规模:1.2M 样本(120万样本)

覆盖学科:数学、物理、化学、生物学、地理学、计算机科学、经济学、历史、音乐、体育,共10个学科及其细分子领域。

任务类型:支持文本到图像生成(Text-to-Image Generation)和图像编辑(Image Editing)。

数据集构建方法:采用四种互补的构建管线:

  1. 基于SVG/TikZ的结构化渲染(Structured Rendering with SVG/TikZ)
  2. 基于OCR的编辑(OCR-based Editing)
  3. 大规模文本到图像过滤(Large-scale T2I Filtering)
  4. 专门化的程序化合成(Specialized Programmatic Synthesis)

数据内容:包含标题(captions)、编辑指令(editing instructions)、结构化注解(structured annotations)以及具有可控语义差异的配对图像。

基准测试表现:在学科相关基准(GenExam、GRADE)上显著优于开源基线模型;在通用推理基准(WISE、RISE)上也展现出更广泛的迁移能力。

发布时间:相关论文发表于 arXiv,编号 arXiv:2607.02290(2026年)。

发布资源:数据集、模型及数据构建管线的源代码将公开发布(包括论文、代码和数据集链接)。

主要贡献机构:上海交通大学、华南理工大学、厦门大学、中国科学技术大学。

搜集汇总
数据集介绍
DisciplineGen-1M 数据集图片
构建方式
DisciplineGen-1M的构建采用了一种可扩展的多源融合框架,针对学科图像的异构性设计了四条互补的数据流水线。首先,通过矢量图形渲染(基于SVG和TikZ)合成高分辨率、语义可控的配对图像,涵盖生物、物理、经济等学科。其次,OCR编辑流水线利用光学字符识别提取文本区域,并由视觉语言模型筛选合适区域进行掩码,从而生成编辑任务所需的输入-目标图像对。第三,大规模文本到图像过滤流水线对开源教育图像进行去重、分辨率筛选,并借助多模态模型对图像的学科相关性、图解性质、文本丰富度等多维度评分,保留高质量样本。最后,程序化合成流水线针对数学、化学、计算机科学、历史、音乐和体育等学科设计专用引擎,通过确定性算法生成具有精确语义差异的配对图像。四条流水线输出的数据均采用统一的标注格式,同时支持文本到图像生成和图像编辑两种任务。
特点
该数据集的核心特点在于其多学科覆盖、结构化监督与知识密集性。DisciplineGen-1M包含120万样本,跨越数学、物理、化学、生物、地理、计算机科学、经济、历史、音乐和体育十大学科,覆盖图表、几何图形、分子结构、乐谱、地图、时序图等多种结构化视觉形式。每条样本不仅包含图像与文本描述,还保留了精确的空间关系、符号约束和学科概念标注,使得生成结果必须符合知识正确性而非仅追求视觉美感。数据集同时支持文本到图像生成与图像编辑两种任务范式,且编辑数据通过结构化变换(如标签填充、曲线平移、功能基团插入)确保配对的像素级一致性。这种设计使得模型能够学习到学科知识的具体视觉表达,推动图像生成从美学合理性迈向可验证的知识驱动创作。
使用方法
使用DisciplineGen-1M时,研究人员可直接加载统一的JSONL格式数据,每条记录包含图像路径、自然语言描述(或编辑指令)以及学科和子领域标签。该数据集支持两种典型训练范式:文本到图像生成任务中,模型接收学科相关的描述性提示生成对应图解;图像编辑任务中,模型接收输入图像与编辑指令,输出经过修改的目标图像。研究者可基于该数据集对现有图像生成模型进行微调,例如通过LoRA适配器在保持基座模型通用视觉先验的同时适应学科图解的特殊布局与符号约束。数据集附带了基于Qwen3-VL与Qwen-Image的推理-生成两阶段训练框架,可复现原文中的实验设定。此外,数据构建的源代码也已开源,便于用户针对特定学科扩展或定制数据流水线。
背景与挑战
背景概述
近年来,图像生成与编辑模型在生成视觉上引人入胜的自然图像方面取得了显著进展,然而在面对知识密集型图表时,其表现往往不尽如人意。这类学术图像的正确性高度依赖于学科概念、符号结构以及精确的空间关系,而非单纯的美学吸引。为填补这一空白,上海交通大学的Zhaokai Wang等人于2026年提出了DisciplineGen-1M数据集。该数据集由上海交通大学、华南理工大学、厦门大学及中国科学技术大学联合创建,旨在构建一个百万级规模的多学科视觉生成与编辑资源。其核心研究问题在于,如何促使生成模型摆脱对表面视觉相似性的依赖,转向对学科知识的精确理解与可验证的结构化创作。DisciplineGen-1M涵盖了数学、物理、化学、生物、地理、计算机科学、经济学、历史、音乐和体育等十个学科,包含了120万样本,为多学科领域内的文本到图像生成与图像编辑提供了结构化的监督信号。该数据集的出现,显著推动了图像生成从单纯追求审美合理性迈向知识锚定的视觉创作新范式。
当前挑战
DisciplineGen-1M旨在解决图像生成与编辑领域长期存在的一项关键挑战:现有模型在处理需精确理解学科概念、复杂结构分析与深度推理的知识密集型学术图像时,表现极为有限。相比于自然图像,学术图表中的微小错误——如符号、标签、图边、分子基团或记号的偏差——足以导致结果完全失效。这种对结构正确性与学术知识的高要求,远超通用常识推理的范畴,构成了该领域特有的瓶颈。在数据集构建过程中,团队同样面临严峻挑战:学术图像并非单一视觉领域,而是涵盖矢量图、文本标签补全、领域特定引擎输出及噪声网络图像等多种类型。为应对这一异质性,研究团队创新性地融合了矢量图形渲染、基于OCR的编辑、程序化领域引擎合成以及大规模文本到图像过滤四种互补策略,构建了可扩展的数据生成框架,从而在兼顾多学科覆盖的同时,确保了数据的高质量与结构一致性。
常用场景
经典使用场景
在知识密集型图像生成与编辑领域,DisciplineGen-1M被广泛用于构建和评估面向多学科结构化视觉内容的生成模型。该数据集涵盖数学、物理、化学、生物、地理、计算机科学、经济学、历史、音乐和体育等十大学科,共计120万样本。研究者可在此基础上训练文本到图像生成模型与图像编辑模型,使其能够准确复现学科概念图、分子结构、乐谱、图表和地图等需要严格遵循学科知识与空间关系的视觉内容。该数据集的经典使用方式是将隐式的学科指令转化为显式的推理规划,再由图像生成器完成最终输出,从而验证模型在学科特定视觉生成任务中的表现。
衍生相关工作
基于DisciplineGen-1M,衍生了一系列具有代表性的研究工作。在基准评测方面,GenExam与GRADE分别被提出用于评估多学科文本到图像生成与图像编辑能力,而WISE和RISE则拓展至通用世界知识与推理感知的视觉编辑评测。在模型架构方面,研究者在其基础上开发了学科感知的推理-生成联合模型,将Qwen3-VL作为推理模块以生成显式学科推理计划,再交由Qwen-Image完成图像合成。此外,该数据集还催生了结构化向量渲染与OCR编辑结合的自动化数据构建框架,为后续更大规模的学科视觉数据集建设提供了可复现的范式参考。
数据集最近研究
最新研究方向
将大规模多学科结构化视觉数据作为推动图像生成从美学逼真迈向可验证知识驱动创作的核心引擎,聚焦于学科图解、符号逻辑与空间关系的精准可控生成与编辑。前沿研究通过融合矢量渲染、程序化合成与OCR过滤的混合数据构建框架,突破传统自然图像模型在处理知识密集型图表时的符号歧义与结构失准瓶颈。在数学、物理、化学等十大学科领域,该数据集催生了基于学科推理的生成范式,使得模型在分子结构连接性、图谱拓扑约束、乐谱符号编排等细粒度要求上实现质的飞跃,并在广泛的知识推理基准中展现出跨领域迁移能力——这不仅显著缩小了开源模型与闭源系统的性能鸿沟,更为教育可视化、科学文献自动化及智能辅导系统提供了可验证的视觉知识底座,标志着图像生成领域正从外观相似性竞赛转向认知正确性验证的范式转型。
相关研究论文
  • 1
    DisciplineGen-1M: A Large-Scale Dataset for Multidisciplinary Visual Generation and Editing上海交通大学; 华南理工大学; 厦门大学; 中国科学技术大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务