zmli/G-Substrate-Data
收藏官方服务:
资源简介:
G-Substrate数据集是一个图结构数据集,旨在将图结构视为跨异构数据模态和任务的持久结构基底。它包含四个领域的图结构数据:事件图(事件关系提取)、图搜索(图算法推理)、分子图(分子描述)和场景图(场景图生成),所有数据都组织在统一的结构模式中,并使用与LLaMA-Factory兼容的ShareGPT对话格式。
G-Substrate introduces a representation-centric perspective where graph structure is treated as a persistent structural substrate that accumulates across heterogeneous data modalities and tasks. This dataset contains graph-structured data across four domains, organized under a unified structural schema. All data uses the ShareGPT conversation format compatible with LLaMA-Factory.
提供机构:
zmli搜集汇总
数据集介绍

构建方式
G-Substrate-Data数据集源自ICML 2026论文《Graph is a Substrate Across Data Modalities》,其构建遵循一种以表征为中心的理念,即将图结构视为一种持久的结构性基底,能够跨异构数据模态和任务进行累积与泛化。该数据集通过统一的图结构模式,整合了来自视觉、文本、算法及科学四大领域的图数据:场景图源自Visual Genome VG150,事件图整合了MAVEN-ERE、MATRES与HiEve三个语料库,分子图来源于Mol-Instructions,图算法推理数据则来自NLGraph与GVLQA。所有数据均转换为ShareGPT对话格式,并包含任务标签以区分领域与任务类型,同时提供可复现的数据处理脚本,支持从原始源数据重新生成统一模式的数据集。
特点
该数据集的核心特点在于其跨领域、多任务的统一结构设计,将原本异构的图数据纳入同一套表示框架下,显著提升了数据在模型训练中的可迁移性与复用性。数据集涵盖了场景图生成、事件关系抽取、图算法推理与分子属性描述四类典型任务,每类数据均以标准的JSON文件存储,并附带任务标签,便于模型感知任务语义。此外,数据集还提供了角色间插混合训练数据(interleave.json),进一步增强了模型在多任务学习中的表征融合能力。所有图像引用均基于Visual Genome的相对路径,保留了原始空间信息,便于下游任务中的图像-图联合推理。
使用方法
该数据集专为与LLaMA-Factory训练框架兼容而设计,用户只需将数据集目录放置于data/路径下,借助提供的dataset_info.json文件即可快速配置训练任务。对于视觉相关的场景图任务,需额外下载Visual Genome图像并按照VG_100K与VG_100K_2两个子目录组织到images/文件夹中,并在训练时指定image_dir参数以正确解析图像路径。研究者亦可利用仓库中的转化脚本,从原始数据源(如NLGraph、Mol-Instructions等)自行重建数据,便于进行数据增强或定制化实验。最终通过llamafactory-cli train config.yaml命令即可启动模型微调流程。
背景与挑战
背景概述
在深度学习领域,不同数据模态(如图像、文本、分子结构)的传统方法往往依赖各自特定的表示范式,导致模型跨模态泛化能力受限。G-Substrate-Data数据集由李梓铭、吴晓明等研究者于2026年在ICML会议上提出,旨在探索图结构作为一种通用结构基板(structural substrate)在异构数据模态间的统一表征潜力。该数据集覆盖场景图、事件图、分子图与图算法推理四大领域,基于统一的ShareGPT对话格式组织,为多模态多任务学习提供了规范化基准。其核心研究问题在于验证图是否能作为跨越视觉、语言与科学域的结构共享载体,从而推动基础模型向通用图智能体的演进。
当前挑战
G-Substrate-Data面临的核心挑战包括:1)领域问题层面,如何设计统一的图结构表示以兼容视觉场景中的物体关系、文本中的事件演化、分子中的原子键连及算法中的抽象逻辑,避免模态间的语义鸿沟;2)构建过程层面,原始数据源(如Visual Genome、MAVEN-ERE、Mol-Instructions)格式异构,需设计跨库转换脚本(如transform_sgg.py)以保证图结构的规范化与对话模板的一致性;3)多模态数据对齐,尤其是场景图中图像与图结构事实的时空同步,以及图搜索任务中精确推理链的标注质量,均对数据集构建提出了严苛的工程与验证要求。
常用场景
经典使用场景
在跨模态与跨任务图结构学习的探索中,G-Substrate-Data数据集为模型提供了统一的结构化基底。其经典使用场景集中在将图结构作为持久的结构化基质,串联视觉、文本、算法与科学分子等异质模态。具体而言,研究者可利用该数据集训练多任务图文模型,使其在场景图生成、事件关系抽取、图算法推理与分子属性描述等任务间无缝迁移。数据集采用统一的ShareGPT对话格式与任务标签,兼容LLaMA-Factory工具链,大幅降低了多模态图学习的数据预处理门槛。这种设计使得模型能够在一个共享的图表示空间内同时理解图像中的物体关系、文本中的事件逻辑、算法中的结构属性以及分子的化学拓扑,从而推动图作为通用数据基质的理论研究与实践验证。
衍生相关工作
围绕G-Substrate-Data数据集,已有若干经典工作派生而出。论文《Graph is a Substrate Across Data Modalities》作为奠基之作,首次提出图作为跨模态结构基质的理念,并构建了对应的多任务模型G-Substrate-Qwen3-VL-2B,在场景图生成、事件抽取等任务上验证了统一图表示的有效性。该工作催生了基于图基质的多模态融合方法,如利用共享图卷积的跨任务微调策略,以及面向图结构理解的提示学习技术。此外,数据集中统一的Schema设计启发了后续研究在图数据标准化与多任务评测基准构建上的探索,推动了图学习社区对通用图基质的关注与讨论,形成了从数据构建、模型训练到评测体系的全链条研究生态。
数据集最近研究
最新研究方向
G-Substrate-Data 数据集标志着多模态图结构学习领域的一次范式跃迁,其核心贡献在于将图结构升华为跨数据模态的持久结构基板,彻底改变了图数据孤立处理的传统格局。该数据集整合了场景图、事件图、分子图与图算法推理四大领域,构建了统一的表征架构,并特别将视觉场景图与文本事件理解、分子属性预测及算法推理任务交织融合。随着多模态大模型与图神经网络交叉研究的持续升温,G-Substrate-Data 为探索图结构如何作为桥接不同数据形态的普适性媒介提供了关键数据底座,其创新性地引入交错式角色训练数据,直接呼应了当前对可泛化、结构感知基础模型的迫切需求。这一数据集不仅推动了从单模态图分析迈向跨模态结构化推理的研究浪潮,更在分子科学、视觉理解与事件逻辑等交叉领域开辟了崭新的量化评估路径,成为连接图结构理论与多模态智能系统的核心枢纽。
以上内容由遇见数据集搜集并总结生成



