遇见数据集

awesome-multi-view-datasets

收藏
github2025-06-12 更新2026-06-04 收录
官方服务:

资源简介:

这是一个多视图数据集的集合,专注于收集和整理用于多视图多标签学习和多视图聚类任务的数据集。合集覆盖了图像、音乐、文本和生物学等多个领域,包括Corel5k、Emotions、Espgame、Iaprtc12、Mirflickr、Pascal07、Yeast、Mfeat、100Leaves、3 Sources、BBC、BBCSport、BDGP_fea、Caltech101系列、cifar10、cifar100等数据集。每个数据集都提供了样本数量、视图数量、特征维度、类别数量等详细信息,并按任务类型进行分类组织。

This is a collection of multi-view datasets dedicated to collecting and curating datasets for multi-view multi-label learning and multi-view clustering tasks. The collection covers multiple domains including images, music, text, biology and others, and encompasses datasets such as Corel5k, Emotions, Espgame, Iaprtc12, Mirflickr, Pascal07, Yeast, Mfeat, 100Leaves, 3 Sources, BBC, BBCSport, BDGP_fea, Caltech101 series, cifar10, and cifar100. Each dataset provides detailed information such as the number of samples, number of views, feature dimensionality, and number of categories, and is organized and classified by task type.

创建时间:
2022-03-09
原始信息汇总

多视图数据集总览

该页面整理了用于多视图学习的各类数据集,主要分为两类:

1. 多视图多标签学习数据集

该类别包含 8 个数据集,覆盖图像音乐生物学领域,具体如下:

数据集 样本数 视图数 特征维度 类别数 标记基数 标记密度 标签区别数 领域
Corel5k 4999 6 100/512/1000/4096/4096/4096 260 3.397 0.013 2992 图像
Emotions 593 2 64/8 6 1.869 0.311 27 音乐
Espgame 20770 6 100/512/1000/4096/4096/4096 268 4.686 - - 图像
Iaprtc12 19627 6 100/512/1000/4096/4096/4096 291 5.719 - - 图像
Mirflickr 25000 6 100/512/1000/4096/4096/4096 38 4.716 0.142 4464 图像
Pascal07 9963 6 100/512/1000/4096/4096/4096 20 1.465 0.073 271 图像
Yeast 2417 2 79/24 14 4.237 0.303 198 生物学
Mfeat 2000 6 76/216/64/240/47/6 10 - - - 图像

2. 多视图聚类数据集

该类别包含 22 个数据集,按数据类型分为文本图像等,并提供外部链接:

文本类 (text):

  • 3 Sources (数据源不详,链接:http://mlg.ucd.ie/datasets/3sources.html)
  • BBC (样本数:685,视图数:4,特征:4659/4633/4665/4684,聚类数:5,链接:http://mlg.ucd.ie/datasets/segment.html)
  • BBCSport (样本数:544,视图数:2,特征:3183/3203,聚类数:5,同上)
  • Reuters (样本数:1200,视图数:5,特征:2000/2000/2000/2000/2000,聚类数:6,链接:http://lig-membres.imag.fr/grimal/data.html)
  • WebKB (样本数:1051,视图数:2,特征:334/2949,聚类数:2,同上)

图像类 (image):

  • Caltech 系列:
    • Caltech101_3view (样本数:512,视图:3,特征:36/254/512,聚类数:11)
    • Caltech101-7 (样本数:1474,视图:6,特征:40/48/254/512/928/1984,聚类数:7)
    • Caltech101-20 (样本数:2386,视图:6,特征:40/48/254/512/928/1984,聚类数:20)
    • Caltech101-all_fea (样本数:9144,视图:5,特征:40/48/254/512/928,聚类数:102)
    • Caltech256_fea (样本数:30607,视图:3,特征:512/1024/2048,聚类数:257)
    • 以上 Caltech 数据集均来自:http://www.vision.caltech.edu/Image_Datasets/
  • Mfeat (手写数字,样本数:2000,视图:6,特征:6/47/64/76/216/240,聚类数:10,链接:https://archive.ics.uci.edu/ml/datasets/Multiple+Features)
  • YoutubeVideo (样本数:101499,视图:5,特征:64/64/512/647/838,聚类数:31,链接:http://archive.ics.uci.edu/ml/datasets/YouTube+Multiview+Video+Games+Dataset#)

其他类型:

  • 100Leaves (样本数:64,视图:3,特征:1600/1600/1600,聚类数:100)
  • BDGP_fea (样本数:2500,视图:3,特征:1000/500/250,聚类数:5)
  • cifar10 (样本数:50000,视图:3,特征:512/1024/2048,聚类数:10)
  • cifar100 (样本数:50000,视图:3,特征:512/1024/2048,聚类数:100)
  • NUS-WIDE-OBJ (样本数:30000,视图:5,特征:65/74/129/145/226,聚类数:31,链接:http://lms.comp.nus.edu.sg/research/NUS-WIDE.htm)
  • NGs (样本数:500,视图:3,特征:2000/2000/2000,聚类数:5)
  • prokaryotic (样本数:551,视图:3,特征:3/393/438,聚类数:4)
  • proteinFold (样本数:694,视图:12,特征:各视图均为27,聚类数:27)
  • synthetic3d (样本数:600,视图:3,特征:3/3/3,聚类数:3)
搜集汇总
数据集介绍
awesome-multi-view-datasets 数据集图片
构建方式
该数据集库精心汇集了多视角学习领域广泛使用的公开数据集,涵盖多视角多标签学习与多视角聚类两大核心任务。在多视角多标签学习部分,数据集如Corel5k、Emotions、Yeast等,均来源于图像、音乐、生物学等不同领域,每个数据集均包含多个视角的特征描述,例如Corel5k图像数据拥有六种不同维度的特征向量。多视角聚类部分则囊括了Caltech101、BBC、Reuters等经典数据集,覆盖图像与文本模态,每个样本均通过多个特征提取方式或传感器获取异构特征,形成多视角表征。所有数据集均经由领域内学者筛选与标准化处理,确保其适用于多视角算法的评估与比较。
使用方法
使用者可根据研究任务从表格中选取所需数据集。对于多视角多标签学习,可直接依据数据集名称及样本数、标签基数等统计信息,下载对应原始数据并提取多视角特征矩阵。对于多视角聚类任务,则可通过提供的URL链接访问官方源站获取数据,或直接使用特征文件(如BDGP_fea)。部分数据集如Mfeat、Reuters已内置视角划分,加载后即可直接用于模型训练与评估。建议结合多视角学习框架(如PyTorch、Scikit-learn)进行特征预处理与视角对齐,以发挥多视角数据的协同优势。
背景与挑战
背景概述
多视图学习作为机器学习和数据挖掘领域的重要分支,致力于整合来自不同视角或特征空间的数据信息,以提升模型的泛化性能和鲁棒性。近年来,随着图像、文本、生物信息等多源数据的爆炸式增长,研究者对高质量多视图数据集的需求愈发迫切。该数据集仓库由领域内学者整理,汇集了多视图多标签学习与多视图聚类两大任务的经典数据集,创建时间可追溯至多视图学习研究兴起阶段。核心研究问题聚焦于如何有效利用异构特征间的互补性,解决高维、稀疏、多标签等复杂场景下的学习难题。这些数据集广泛应用于图像识别、音乐情感分析、生物信息学等前沿领域,为多视图算法的验证与对比提供了标准化基准,显著推动了该领域的学术进展。
当前挑战
当前多视图数据集面临的核心挑战在于领域问题的复杂性与构建过程的困难。领域问题层面,多视图多标签学习需应对标签高度稀疏与样本分布不均的困境,如Corel5k数据集标签密度仅0.013,而多视图聚类则需处理视图间特征维度的巨大差异与样本量不足的矛盾,如100Leaves数据集仅含64个样本却需区分100个类别。构建过程中,数据采集成本高昂,需从多个异构源同步获取特征,例如图像数据集需同时提取颜色、纹理、深度等多模态信息;数据标注依赖专家知识,尤其在生物信息领域(如Yeast数据集)需专业实验验证;不同视图间的对齐与缺失值处理亦构成技术瓶颈,导致现有数据集规模有限、领域覆盖不均衡,难以充分支撑大规模深度学习模型的训练需求。
常用场景
经典使用场景
在多视图学习领域,该数据集集合为研究者和工程师提供了极具价值的基准资源。以多视图多标签学习任务为例,Corel5k、Espgame、Iaprtc12和Mirflickr等图像数据集,以及Emotions音乐数据集和Yeast生物学数据集,均被广泛用于验证融合不同特征视图(如颜色直方图、纹理描述符、深层语义特征)以提升标签预测精度的算法效能。这些数据集的样本规模从数百到数万不等,特征维度跨越数十至数千维,标签密度与类别分布各异,为评估模型在异构多视图数据上的泛化能力提供了丰富的实验场景。
解决学术问题
该数据集集合有效解决了多视图学习研究中长期存在的基准不统一问题,推动了多个学术难题的攻克。在多视图聚类任务中,诸如Caltech101系列、BBC文本数据集和Reuters语料库等资源,使得研究者能够系统性地探索视图间信息互补与一致性的融合机制,从而克服传统单视图聚类方法在复杂数据分布下的性能瓶颈。这些数据集的引入不仅促进了非负矩阵分解、深度子空间聚类等经典理论的迭代,还催生了针对视图缺失、噪声干扰等现实挑战的鲁棒算法,显著提升了多视图数据挖掘的理论深度与实践价值。
实际应用
在实际应用层面,该数据集集合的广泛覆盖性使其在多个领域展现出卓越的实用价值。在图像理解领域,NUS-WIDE-OBJ和YoutubeVideo等大规模多视图数据集被用于开发跨模态检索系统,整合视觉外观、文本标签及音频特征以提升搜索精准度。在生物信息学中,Yeast和prokaryotic数据集助力构建融合基因表达谱与蛋白质互作网络的预测模型,加速了功能注释与药物靶点发现。此外,WebKB和Reuters等文本数据集则为多源信息融合的推荐系统与舆情分析提供了测试床,推动了从学术研究到工业落地的技术转化。
数据集最近研究
最新研究方向
多视图学习作为机器学习和数据挖掘领域的前沿方向,近年来在跨模态信息融合与表征学习方面取得了显著突破。awesome-multi-view-datasets数据集集合涵盖了从图像、文本到生物信息等多领域的多视图多标签与聚类任务,其丰富的特征维度与样本规模为研究视图间互补性与一致性的协同建模提供了坚实基础。当前研究热点聚焦于利用深度神经网络捕获视图间的非线性关联,并结合对比学习与自监督范式提升跨视图表征的鲁棒性,尤其在处理高维异构数据时展现出卓越效能。该数据集在推动多视图学习理论向实际应用转化中扮演了关键角色,为智能医疗诊断、多模态情感分析及大规模图像理解等热点应用场景提供了标准化评估基准,其影响力正随着多模态人工智能的蓬勃发展而持续扩大。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务