MindCube|多模态AI数据集|空间推理数据集
收藏MindCube 数据集概述
数据集基本信息
- 名称: MindCube: Spatial Mental Modeling from Limited Views
- 类型: 空间推理多模态数据集
- 维护机构: MLL-Lab
- 相关机构: 西北大学、斯坦福大学、纽约大学、华盛顿大学
- 许可证: MIT License
- 数据获取:
- Hugging Face数据集地址: https://huggingface.co/datasets/MLL-Lab/MindCube
- 项目主页: https://mind-cube.github.io/
数据集内容
- 数据格式: JSONL文件
- 核心文件:
- MindCube_train.jsonl
- MindCube_tinybench.jsonl
- 处理流程:
- 原始数据 → 支架数据(认知地图+推理链)
- 生成8种任务变体的模型提示
- 转换为模型特定格式(支持Qwen2.5VL格式)
数据集特点
- 任务类型: 8种不同的空间推理任务
- 评估指标: 包含全面的性能评估体系
- 配套工具: 提供完整的数据处理、模型训练和评估脚本
适用场景
- 多模态AI模型的训练与评估
- 空间推理能力研究
- 视觉语言模型的监督微调(SFT)
使用方式
-
数据下载: bash bash scripts/bash_scripts/download_data.bash
-
数据处理: bash bash scripts/bash_scripts/generate_eval_data.bash
-
模型训练: bash bash scripts/bash_scripts/run_sft_all_tasks_qwen.sh
相关资源
- 预训练模型检查点: https://huggingface.co/MLL-Lab/models
- 修改版Qwen2.5-VL代码库: git@github.com:QinengWang-Aiden/Qwen2.5-VL-MindCube.git

OpenSonarDatasets
OpenSonarDatasets是一个致力于整合开放源代码声纳数据集的仓库,旨在为水下研究和开发提供便利。该仓库鼓励研究人员扩展当前的数据集集合,以增加开放源代码声纳数据集的可见性,并提供一个更容易查找和比较数据集的方式。
github 收录
AIS数据集
该研究使用了多个公开的AIS数据集,这些数据集经过过滤、清理和统计分析。数据集涵盖了多种类型的船舶,并提供了关于船舶位置、速度和航向的关键信息。数据集包括来自19,185艘船舶的AIS消息,总计约6.4亿条记录。
github 收录
中国1km分辨率逐月平均气温数据集(1901-2024)
该数据为中国逐月平均温度数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2024.12。数据格式为NETCDF,即.nc格式。数据单位为0.1 ℃。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
China Air Quality Historical Data
该数据集包含了中国多个城市的空气质量历史数据,涵盖了PM2.5、PM10、SO2、NO2、CO、O3等污染物浓度以及空气质量指数(AQI)等信息。数据按小时记录,提供了详细的空气质量监测数据。
www.cnemc.cn 收录
DermNet
DermNet是一个包含皮肤病图像的数据集,涵盖了多种皮肤病类型,如痤疮、湿疹、牛皮癣等。该数据集主要用于皮肤病诊断和研究。
www.dermnetnz.org 收录