多模态知识图谱数据集
收藏资源简介:
本目录存放用于多模态知识图谱补全实验的结构化三元组数据,包括MKG-W、MKG-Y、DB15K、TIVA和Kuai16K等数据集。这些数据集包含实体、关系、训练、验证和测试三元组,支持结构、视觉、文本和数值模态。数据格式遵循OpenKE/NativE约定,提供实体映射、关系映射、类型约束和关系模式子集等文件。
This directory stores structured triple data for multimodal knowledge graph completion experiments, including datasets such as MKG-W, MKG-Y, DB15K, TIVA and Kuai16K. These datasets contain entities, relations, training, validation and testing triples, and support structural, visual, textual and numerical modalities. The data format follows the OpenKE/NativE conventions, and provides files including entity mappings, relation mappings, type constraints and relation schema subsets.
数据集概览
该数据集仓库用于**多模态知识图谱补全(MMKGC)**实验,包含多个子数据集,每个子集提供结构化三元组及多模态特征(视觉/文本)。数据集格式遵循 OpenKE / NativE 约定。
主要数据集
| 数据集 | 实体数 | 关系数 | 训练三元组 | 验证三元组 | 测试三元组 | 模态 |
|---|---|---|---|---|---|---|
| MKG-W | 15,000 | 169 | 34,196 | 4,276 | 4,274 | 结构 + 视觉 + 文本 |
| MKG-Y | 15,000 | 28 | 21,310 | 2,665 | 2,663 | 结构 + 视觉 + 文本 |
| DB15K | 12,842 | 279 | 79,222 | 9,904 | 9,902 | 结构 + 视觉 + 文本 + 数值 |
| TIVA | 11,858 | 16 | 20,071 | 2,000 | 2,000 | 结构 + 视觉 + 文本 |
| Kuai16K | 16,015 | 4 | 180,190 | 22,523 | 22,525 | 结构 + 视觉 + 文本 |
关系模式测试子集(按关系模式划分的三元组数量)
| 数据集 | 1-1 | 1-n | n-1 | n-n |
|---|---|---|---|---|
| MKG-W | 247 | 18 | 2,991 | 1,018 |
| MKG-Y | 90 | 468 | 246 | 1,859 |
| DB15K | 385 | 195 | 3,887 | 5,435 |
| TIVA | 0 | 0 | 0 | 2,000 |
| Kuai16K | 50 | 0 | 247 | 22,228 |
目录结构
每个数据集位于 benchmarks/ 下的独立子目录,标准布局如下:
benchmarks/ ├── MKG-W/ │ ├── entity2id.txt # 实体 → 整数 ID │ ├── relation2id.txt # 关系 → 整数 ID │ ├── train2id.txt # 训练三元组 │ ├── valid2id.txt # 验证三元组 │ ├── test2id.txt # 测试三元组 │ ├── test2id_all.txt # 带预测方向的测试格式 │ ├── type_constrain.txt # 关系类型约束 │ ├── 1-1.txt / 1-n.txt / n-1.txt / n-n.txt # 关系模式子集 │ └── n-n.py # 生成子集脚本 ├── MKG-Y/ ├── DB15K/ # 额外含 train.txt / valid.txt / test.txt(原始 URI) ├── TIVA/ └── Kuai16K/
可选子目录(用于训练集比例消融,如 MKG-W_tr80、MKG-W_tr50、MKG-W_tr30),仅替换 train2id.txt,其余文件与全量 MKG-W 相同。
文件格式
- 三元组文件(
train2id.txt/valid2id.txt/test2id.txt):首行为三元组总数,后续每行三个整数(头实体ID、尾实体ID、关系ID),空格分隔。 - 实体/关系映射(
entity2id.txt/relation2id.txt):首行为条目总数,后续每行名称与 ID 分隔符因数据集而异(MKG-W/MKG-Y/DB15K 用空格,TIVA/Kuai16K 用 Tab)。 - 类型约束(
type_constrain.txt):首行为关系数,后续每行以关系 ID 开头,后跟允许的尾/头实体 ID 列表,Tab 分隔。 - 测试集扩展格式(
test2id_all.txt):每行包含方向与候选实体 ID 列表,用于指定头/尾预测任务。 - DB15K 原始三元组:RDF 风格,每行
URI URI URI .,对应整数 ID 版本同样可用。
多模态嵌入
视觉与文本特征需单独下载,放入 embeddings/ 目录:
embeddings/ ├── MKG-W-visual.pth ├── MKG-W-textual.pth ├── MKG-Y-visual.pth ├── MKG-Y-textual.pth ├── DB15K-visual.pth ├── DB15K-textual.pth └── ...
- 下载地址:Google Drive(NativE 官方)
- 命名规则:
{dataset}-visual.pth、{dataset}-textual.pth - 张量形状:每个
.pth为torch.Tensor,行数 ≥ 对应实体数,视觉特征默认维度 4096。
使用方式
-
训练:通过
-dataset参数指定数据集,加载路径为./benchmarks/<dataset>/,例如:python run_adv_wgan_gp_mlp_mamba_multiscale_xyfusion_gatefusionv2_with_loss.py -dataset MKG-W -batch_size 1024 -margin 4 -epoch 400 -dim 500 -save ./checkpoint/MKGW_gfv2
-
分关系模式评估:指定
-test_split参数使用1-1、1-n、n-1、n-n子集作为测试集。 -
生成 MKG-W 训练子集:使用脚本
scripts/make_mkgw_train_subset_benchmarks.py,可指定种子和比例。
数据划分约定
train2id.txt:训练期负采样与参数更新valid2id.txt:验证集评估与早停test2id.txt:最终测试指标(MRR、MR、Hits@1/@3/@10)
引用
使用数据集时请引用原始论文,若使用 NativE 框架提供的 MKG-W / MKG-Y 划分与嵌入,请引用:
@inproceedings{DBLP:conf/sigir/ZhangCGXHLZC24, author = {Yichi Zhang and Zhuo Chen and Lingbing Guo and Yajing Xu and Binbin Hu and Ziqi Liu and Wen Zhang and Huajun Chen}, title = {NativE: Multi-modal Knowledge Graph Completion in the Wild}, booktitle = {SIGIR}, pages = {91--101}, year = {2024} }
- NativE 论文:ACM | arXiv
- 上游数据仓库:zjukg/NATIVE





