遇见数据集

多模态知识图谱数据集

收藏
github2026-07-06 更新2026-07-27 收录
官方服务:

资源简介:

本目录存放用于多模态知识图谱补全实验的结构化三元组数据,包括MKG-W、MKG-Y、DB15K、TIVA和Kuai16K等数据集。这些数据集包含实体、关系、训练、验证和测试三元组,支持结构、视觉、文本和数值模态。数据格式遵循OpenKE/NativE约定,提供实体映射、关系映射、类型约束和关系模式子集等文件。

This directory stores structured triple data for multimodal knowledge graph completion experiments, including datasets such as MKG-W, MKG-Y, DB15K, TIVA and Kuai16K. These datasets contain entities, relations, training, validation and testing triples, and support structural, visual, textual and numerical modalities. The data format follows the OpenKE/NativE conventions, and provides files including entity mappings, relation mappings, type constraints and relation schema subsets.

创建时间:
2026-07-06
原始信息汇总

数据集概览

该数据集仓库用于**多模态知识图谱补全(MMKGC)**实验,包含多个子数据集,每个子集提供结构化三元组及多模态特征(视觉/文本)。数据集格式遵循 OpenKE / NativE 约定。

主要数据集

数据集 实体数 关系数 训练三元组 验证三元组 测试三元组 模态
MKG-W 15,000 169 34,196 4,276 4,274 结构 + 视觉 + 文本
MKG-Y 15,000 28 21,310 2,665 2,663 结构 + 视觉 + 文本
DB15K 12,842 279 79,222 9,904 9,902 结构 + 视觉 + 文本 + 数值
TIVA 11,858 16 20,071 2,000 2,000 结构 + 视觉 + 文本
Kuai16K 16,015 4 180,190 22,523 22,525 结构 + 视觉 + 文本

关系模式测试子集(按关系模式划分的三元组数量)

数据集 1-1 1-n n-1 n-n
MKG-W 247 18 2,991 1,018
MKG-Y 90 468 246 1,859
DB15K 385 195 3,887 5,435
TIVA 0 0 0 2,000
Kuai16K 50 0 247 22,228

目录结构

每个数据集位于 benchmarks/ 下的独立子目录,标准布局如下:

benchmarks/ ├── MKG-W/ │ ├── entity2id.txt # 实体 → 整数 ID │ ├── relation2id.txt # 关系 → 整数 ID │ ├── train2id.txt # 训练三元组 │ ├── valid2id.txt # 验证三元组 │ ├── test2id.txt # 测试三元组 │ ├── test2id_all.txt # 带预测方向的测试格式 │ ├── type_constrain.txt # 关系类型约束 │ ├── 1-1.txt / 1-n.txt / n-1.txt / n-n.txt # 关系模式子集 │ └── n-n.py # 生成子集脚本 ├── MKG-Y/ ├── DB15K/ # 额外含 train.txt / valid.txt / test.txt(原始 URI) ├── TIVA/ └── Kuai16K/

可选子目录(用于训练集比例消融,如 MKG-W_tr80、MKG-W_tr50、MKG-W_tr30),仅替换 train2id.txt,其余文件与全量 MKG-W 相同。

文件格式

  • 三元组文件(train2id.txt / valid2id.txt / test2id.txt):首行为三元组总数,后续每行三个整数(头实体ID、尾实体ID、关系ID),空格分隔。
  • 实体/关系映射(entity2id.txt / relation2id.txt):首行为条目总数,后续每行名称与 ID 分隔符因数据集而异(MKG-W/MKG-Y/DB15K 用空格,TIVA/Kuai16K 用 Tab)。
  • 类型约束(type_constrain.txt):首行为关系数,后续每行以关系 ID 开头,后跟允许的尾/头实体 ID 列表,Tab 分隔。
  • 测试集扩展格式(test2id_all.txt):每行包含方向与候选实体 ID 列表,用于指定头/尾预测任务。
  • DB15K 原始三元组:RDF 风格,每行 URI URI URI .,对应整数 ID 版本同样可用。

多模态嵌入

视觉与文本特征需单独下载,放入 embeddings/ 目录:

embeddings/ ├── MKG-W-visual.pth ├── MKG-W-textual.pth ├── MKG-Y-visual.pth ├── MKG-Y-textual.pth ├── DB15K-visual.pth ├── DB15K-textual.pth └── ...

  • 下载地址:Google Drive(NativE 官方)
  • 命名规则:{dataset}-visual.pth、{dataset}-textual.pth
  • 张量形状:每个 .pth 为 torch.Tensor,行数 ≥ 对应实体数,视觉特征默认维度 4096。

使用方式

  • 训练:通过 -dataset 参数指定数据集,加载路径为 ./benchmarks/<dataset>/,例如:

    python run_adv_wgan_gp_mlp_mamba_multiscale_xyfusion_gatefusionv2_with_loss.py -dataset MKG-W -batch_size 1024 -margin 4 -epoch 400 -dim 500 -save ./checkpoint/MKGW_gfv2

  • 分关系模式评估:指定 -test_split 参数使用 1-1、1-n、n-1、n-n 子集作为测试集。

  • 生成 MKG-W 训练子集:使用脚本 scripts/make_mkgw_train_subset_benchmarks.py,可指定种子和比例。

数据划分约定

  • train2id.txt:训练期负采样与参数更新
  • valid2id.txt:验证集评估与早停
  • test2id.txt:最终测试指标(MRR、MR、Hits@1/@3/@10)

引用

使用数据集时请引用原始论文,若使用 NativE 框架提供的 MKG-W / MKG-Y 划分与嵌入,请引用:

@inproceedings{DBLP:conf/sigir/ZhangCGXHLZC24, author = {Yichi Zhang and Zhuo Chen and Lingbing Guo and Yajing Xu and Binbin Hu and Ziqi Liu and Wen Zhang and Huajun Chen}, title = {NativE: Multi-modal Knowledge Graph Completion in the Wild}, booktitle = {SIGIR}, pages = {91--101}, year = {2024} }

搜集汇总
数据集介绍
多模态知识图谱数据集 数据集图片
构建方式
该多模态知识图谱数据集严格遵循OpenKE与NativE框架的约定格式进行构建,旨在支撑多模态知识图谱补全实验。数据集涵盖MKG-W、MKG-Y、DB15K、TIVA及Kuai16K五个子集,每个子集均包含结构化的三元组文件,如train2id.txt、valid2id.txt与test2id.txt,分别用于训练、验证与测试。三元组文件首行记录总数,后续每行以空格分隔的头实体、尾实体与关系ID形式呈现。实体与关系映射文件entity2id.txt与relation2id.txt采用名称与ID配对方式,其中MKG-W、MKG-Y与DB15K以空格分隔,TIVA与Kuai16K则以制表符分隔。此外,类型约束文件type_constrain.txt用于过滤评估,确保候选实体合法性。视觉与文本特征需单独下载至embeddings/目录,并以pth格式存储,其张量行数需不少于实体总数,且特征维度默认为4096。
特点
该数据集最显著的特点是其多模态融合与丰富的关系模式划分。它不仅包含经典的结构化三元组,还整合了视觉与文本特征,甚至DB15K子集额外包含数值模态,为多模态知识图谱补全提供了全面的数据支撑。每个子集均提供实体与关系的完整映射,并附带类型约束文件以支持过滤评估。尤为突出的是,数据集引入了关系模式测试子集,依据头-关系-尾组合在全集上的出现频次,将三元组精确划分为1-1、1-n、n-1与n-n四类,从而能够深入分析不同关系模式下链接预测的性能差异。此外,还提供了训练集比例消融的子集,如MKG-W_tr80等,便于研究训练数据规模对模型效果的影响。
使用方法
使用该数据集时,首先需确保将下载的多模态特征文件放入仓库根目录的embeddings/文件夹,并确保文件名与数据集名称严格一致。训练时通过-dataset参数指定数据集名称,如MKG-W,代码将自动从benchmarks/<名称>/加载三元组与类型约束文件。推荐超参数与训练脚本详见仓库README。评估阶段,可利用-test_split参数指定关系模式子集(如1-n)作为测试集,但需预先编译含setTestPath的Base.so文件。此外,可通过scripts/make_mkgw_train_subset_benchmarks.py脚本生成MKG-W的训练比例子集,以便进行消融实验。最终评估指标包括MRR、MR及Hits@K,并分别报告头实体与尾实体预测结果。
背景与挑战
背景概述
多模态知识图谱补全(MMKGC)领域旨在融合结构化三元组与视觉、文本等非结构化信息,以提升知识图谱的完备性与推理能力。该数据集由浙江大学等机构的研究人员于2024年构建,核心研究问题在于如何应对真实场景中模态覆盖不均衡、关系模式多样等挑战,进而推动多模态知识图谱的链接预测性能。其中,MKG-W与MKG-Y源自WildKGC项目,DB15K基于DBpedia子集,Kuai16K则聚焦短视频领域,显著扩展了评估的覆盖面与复杂性。这些数据集的发布为MMKGC研究提供了标准化基准,促进了不同方法在统一框架下的公平比较,对知识图谱补全领域具有重要影响。
当前挑战
该数据集所解决的领域问题包括:在不均衡的模态分布下融合结构、视觉与文本特征,抑制单一模态的偏置影响,以及应对1-n、n-n等复杂关系模式带来的稀疏性挑战。构建过程中面临的关键困难包括:原始数据源(如Wikidata、DBpedia)的异构性导致实体对齐与模态特征抽取的复杂度高昂;多模态嵌入张量(如4096维视觉特征)的存储与加载设计需兼顾大规模场景下的效率;此外,训练子集消融实验(如MKG-W_tr30)的生成需保持模态一致性与划分的鲁棒性,进一步加剧了系统构建与验证的难度。
常用场景
经典使用场景
多模态知识图谱数据集的核心应用场景在于支撑多模态知识图谱补全(MMKGC)任务的模型训练与评估。在信息爆炸的时代,单一模态的知识表示已难以满足复杂语义理解的需求,该数据集通过整合结构三元组、视觉特征与文本特征,为研究者提供了统一且标准化的基准平台。其经典使用方式包括训练诸如基于图神经网络或注意力机制的多模态融合模型,以预测缺失链接(如头实体或尾实体的补全),并借助关系模式子集(如1-n、n-n)深入分析不同关系类型下的预测性能,从而验证模型在多样性模态与复杂关系拓扑中的鲁棒性与泛化能力。
实际应用
在现实世界中,该数据集的实用价值体现在短视频推荐、智能问答与跨模态信息检索等多种场景。以Kuai16K数据集为例,其聚焦短视频领域知识图谱,通过融合视觉内容与文本描述,可赋能推荐系统更精准地理解用户偏好与内容语义,从而提升个性化推荐的点击率与用户满意度。此外,基于DB15K等数据集的模型可应用于电商产品知识库的自动补全,通过关联商品图像、属性描述与结构化关系,实现更智能的搜索排序与知识服务,助力企业在海量异构数据中挖掘隐藏关联,优化决策效率。
衍生相关工作
围绕该数据集,学术界已衍生出一系列具有里程碑意义的研究工作。最典型的代表是NativE框架,该工作提出了一种面向现实场景的多模态知识图谱补全方法,通过设计多尺度特征融合与门控机制,有效应对模态不均衡与关系稀疏问题,并在MKG-W、MKG-Y等数据集上取得了显著性能提升,其论文发表于SIGIR 2024。此外,该数据集还催生了基于生成对抗网络(如wGAN-GP)与Mamba架构的补全模型探索,以及针对关系模式特异性设计的评估协议(如1-n子集分析),这些工作不仅深化了对模态交互机制的理解,也为后续研究提供了可复现的基准与范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务