遇见数据集

DisciplineGen-1M

收藏
github2026-07-03 更新2026-07-06 收录
官方服务:

资源简介:

DisciplineGen-1M是一个百万规模的多学科数据集,旨在支持文本到图像(T2I)生成和图像编辑任务。该数据集解决了现有图像生成模型的关键空白:虽然这些模型可以生成视觉上吸引人的自然图像,但在生成依赖于学科概念、符号结构和精确空间关系的知识密集型图表时仍不可靠。数据集包含120万个样本,覆盖数学、物理、化学、生物、地理、计算机科学、经济学、历史、音乐、体育等10多个学科,提供标题、编辑指令、结构化注释以及具有可控语义差异的配对图像。

DisciplineGen-1M is a million-scale multidisciplinary dataset designed to support text-to-image (T2I) generation and image editing tasks. This dataset addresses a critical gap in existing image generation models: while these models can produce visually appealing natural images, they remain unreliable when generating knowledge-intensive diagrams that rely on disciplinary concepts, symbolic structures and precise spatial relationships. The dataset contains 1.2 million samples, covering over 10 disciplines including mathematics, physics, chemistry, biology, geography, computer science, economics, history, music and sports, and provides captions, editing instructions, structured annotations as well as paired images with controllable semantic differences.

创建时间:
2026-07-03
原始信息汇总

数据集概述:DisciplineGen-1M

DisciplineGen-1M 是一个百万级的多学科数据集,旨在支持文本到图像(T2I)生成和图像编辑任务。它解决了现有图像生成模型在知识密集型图表生成上的不足,这类图表依赖于学科概念、符号结构和精确空间关系。

主要特点

  • 双任务支持:同时支持文本生成图像和图像编辑。
  • 学科知识推理:引入了基于学科知识的推理-生成模型。
  • 大规模样本:包含约 120 万样本。
  • 多学科覆盖:涵盖数学、物理、化学、生物学、地理学、计算机科学、经济学、历史、音乐、体育等 10 余个学科。
  • 结构化标注:包含标题、编辑指令、结构化标注以及具有可控语义差异的配对图像。

数据集构建

采用可扩展框架,结合了四种互补方法:

  1. 矢量图形渲染(SVG/TikZ):从矢量图形格式进行结构化渲染。
  2. 基于OCR的编辑:利用光学字符识别创建编辑配对。
  3. 大规模T2I过滤:大规模过滤文本到图像数据。
  4. 专用程序化合成:精选的程序化生成学科内容。

这些流程生成了标题、编辑指令、结构化标注以及具有可控语义差异的配对图像。

数据集示例特点

  • 长且信息密集的提示词。
  • 跨细粒度子领域的多样化主题覆盖。
  • 多种图像类别。
  • 多样的分辨率和宽高比。

研究成果

该方法在学科相关基准(GenExam、GRADE)上相比开源基线取得了实质性改进,并在通用推理知情基准(WISE、RISE)上展现出更广泛的迁移能力。这证明了大规模结构化学术视觉数据对于将图像生成从美学合理性转向可验证的知识驱动视觉创造至关重要。

引用

如您的研究使用该工作,请引用:

bibtex @misc{wang2026disciplinegen1mlargescaledatasetmultidisciplinary, title={DisciplineGen-1M: A Large-Scale Dataset for Multidisciplinary Visual Generation and Editing}, author={Zhaokai Wang and Mingxin Liu and Zirun Zhu and Ziqian Fan and Yiguo He and Mohan Zhang and Leyao Gu and Xiangyu Zhao and Ning Liao and Shaofeng Zhang and Xuanhe Zhou and Zhihang Zhong and Junchi Yan and Xue Yang}, year={2026}, eprint={2607.02290}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2607.02290}, }

搜集汇总
数据集介绍
DisciplineGen-1M 数据集图片
构建方式
DisciplineGen-1M的构建采用了一种可扩展的多管道融合框架,通过四种互补方法协同生成数据。首先,基于矢量图形渲染技术,从SVG和TikZ等结构化格式中提取高保真图像;其次,利用光学字符识别(OCR)技术自动生成编辑指令与对应的图像配对;第三,大规模文本到图像合成过滤策略则从海量生成结果中筛选出符合学科逻辑的样本;最后,通过程序化合成方法针对特定学科内容定制化生成图像。整个流程输出包括详细图像描述、编辑指令、结构化注释以及具有可控语义差异的图像对,确保了数据在学科逻辑与空间关系上的精确性。
使用方法
DisciplineGen-1M的使用可直接通过HuggingFace平台获取完整数据集,研究人员可将其作为训练和评估工具。对于文生图任务,采用图像与对应描述文本配对进行模型微调;对于图像编辑任务,则可利用编辑指令与前后对照图像对以提升模型对结构化知识的理解。实验表明,基于本数据集训练的模型在学科相关基准测试(如GenExam、GRADE)上显著超越开源基线,并在通用推理基准(如WISE、RISE)上展现出良好的迁移能力。数据集遵循CC BY 4.0许可协议,方便学术研究使用。
背景与挑战
背景概述
DisciplineGen-1M是由上海交通大学领衔,联合华南理工大学、厦门大学及中国科学技术大学等多家机构共同创建于2026年的大规模多学科视觉数据集。该数据集旨在解决现有文本到图像生成模型在生成知识密集型图表时可靠性不足的核心问题,这些模型虽能生成美观的自然图像,却难以准确呈现依赖学科概念、符号结构与精确空间关系的视觉内容。数据集包含超过120万样本,覆盖数学、物理、化学、生物学、地理学、计算机科学、经济学、历史学、音乐与体育等十余个学科领域,为多学科视觉生成与编辑提供了结构化的数据基础,对推动生成模型从审美驱动向知识验证驱动的转变具有里程碑意义。
当前挑战
在领域问题层面,现有图像生成模型面临的核心挑战是难以准确生成需要学科知识支撑的视觉内容,如化学分子结构、数学几何图形等,这些内容要求模型理解符号含义、逻辑关系与空间布局,而非仅追求视觉逼真度。在数据集构建过程中,挑战尤为突出:如何从异构的学科资料中系统性抽取结构化视觉信息,并设计可扩展的构建框架以覆盖广袤的学科子领域;同时需要确保生成图像与文本指令之间的语义一致性,并创建具有可控语义差异的配对数据以支持图像编辑任务,这涉及矢量图形渲染、光学字符识别、大规模文本到图像过滤与程序化合成等多种方法的复杂协同。
常用场景
经典使用场景
在视觉生成与编辑领域,现有的文本到图像模型虽能产出视觉上令人愉悦的自然图像,却在涉及数学公式、物理定律、化学分子结构等知识密集型图表的生成中屡屡失误。DisciplineGen-1M数据集应运而生,其经典使用场景聚焦于多学科知识驱动的图像生成与编辑任务。研究者可借助该数据集训练模型,使其能够根据复杂学科描述(如“绘制一个带有坐标轴的二次函数图像”)精准生成并编辑包含符号结构、空间关系与领域概念的视觉内容,从而弥合通用图像生成与学科特异性知识之间的鸿沟。
解决学术问题
当前学术研究面临的核心瓶颈在于,图像生成模型普遍缺乏对学科内在逻辑与符号规则的深刻理解,导致其产出内容往往“形似而神非”。DisciplineGen-1M数据集系统性地解决了这一难题:通过提供涵盖数学、物理、化学等十余个学科、包含120万样本的标注数据,它使研究者得以训练出具备学科推理能力的生成模型,从而在GenExam、GRADE等学科基准上取得显著提升。该数据集的问世标志着图像生成从追求美学“似真性”迈向验证性知识“可靠性”的关键转折。
实际应用
在实际应用层面,DisciplineGen-1M数据集展现出广阔前景:在教育领域,它可赋能智能教学系统自动生成带有精确公式和图示的习题讲解;在科研出版中,能够辅助作者快速绘制规范的学科图表;在科普内容创作里,可依据学科文本直接生成解析性示意图。此外,该数据集支持的图像编辑功能还能用于修订学术文档中的视觉瑕疵,显著降低专家手动校正图表的人力成本,推动知识可视化工具的智能化迭代。
数据集最近研究
最新研究方向
当前,随着文本到图像生成模型在自然场景中取得显著进展,如何确保其生成内容的学科正确性与知识可验证性已成为前沿焦点。DisciplineGen-1M 作为首个百万级多学科视觉生成与编辑数据集,聚焦数学、物理、化学等十余个学科领域,通过矢量图形渲染、OCR编辑、大规模T2I筛选及程序化合成等四类方法构建结构化标注数据,系统性地回应了现有模型在知识密集型图解生成中的符号准确性与空间关系可靠性难题。该数据集不仅支撑图像生成与编辑两项任务,更驱动了学科感知推理生成范式的演进,在GenExam和GRADE等学科基准上超越开源基线,并展现出向WISE、RISE等推理导向基准的迁移能力,标志着图像生成从视觉合理性向可验证知识构建的关键跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务