keep-it-simple-multimodal
收藏资源简介:
该数据集是一个极简的多模态数据集,旨在作为文本数据集“keep-it-simple”的伴侣,用于训练多模态预训练模型(如KairosPretrainingDataset)。数据集包含六种模态的样本:图像+字幕、音频+字幕、视频+字幕、激光雷达点云、IMU传感器数据以及最优控制状态/动作对。所有样本采用统一的模式存储,每行包含以下字段:modality(模态标识符,如image_caption、audio_caption等)、caption(文本标签或控制任务的传递函数参数JSON)、source(来源数据集名称,如flickr8k、audiocaps等)、data(二进制数据,使用numpy.savez打包,包含一个或多个命名的numpy数组,形状和数据类型随数据传递)、meta(额外缩放标量JSON,如sample_rate,或null)。数据可通过numpy.load或kairos.dataset.unpack_multimodal_data解包。数据集来源包括Flickr8k、AudioCaps、Molmo2-VideoCapQA、nuScenes-mini、MotionSense和PixelBytes-OptimalControl,均为小样本切片并经过大幅缩小。数据集规模小于1K样本,适用于多模态学习、机器人控制、自动驾驶等研究与开发。
This dataset is a minimalist multimodal dataset designed as a companion to the text dataset "keep-it-simple" for training multimodal pretrained models (e.g., KairosPretrainingDataset). The dataset contains samples across six modalities: image + caption pairs, audio + caption pairs, video + caption pairs, LiDAR point clouds, IMU sensor data, and optimal control state/action pairs. All samples are stored in a unified schema, with each line containing the following fields: `modality` (modality identifier, e.g., `image_caption`, `audio_caption`, etc.), `caption` (text label or JSON-formatted transfer function parameters for control tasks), `source` (name of the source dataset, e.g., flickr8k, audiocaps, etc.), `data` (binary data packaged via `numpy.savez`, containing one or more named NumPy arrays with shapes and data types varying per sample), and `meta` (additional scaling scalar JSON, e.g., `sample_rate`, or `null`). The data can be unpacked via `numpy.load` or `kairos.dataset.unpack_multimodal_data`. The source datasets for this collection include Flickr8k, AudioCaps, Molmo2-VideoCapQA, nuScenes-mini, MotionSense, and PixelBytes-OptimalControl, all of which are small-sample slices and significantly downsized. The dataset contains fewer than 1,000 samples, and is suitable for research and development in multimodal learning, robotic control, autonomous driving, and other related fields.
数据集概述
keep-it-simple-multimodal 是一个小型的独立多模态数据集,旨在为多模态机器学习任务提供多样化的数据样本。该数据集包含图像、音频、视频、激光雷达(LiDAR)、惯性测量单元(IMU)数据以及最优控制的状态/动作对,共计六种模态类型。此数据集是文本数据集 keep-it-simple 的配套资源,主要用于支持 KairosPretrainingDataset 在 kairos 项目中的预训练任务。
数据集结构
该数据集采用统一的通用模式,每一行数据都遵循相同的结构,不针对特定模态设置独立列,也不假设固定的形状或数据类型。具体字段如下:
| 列名 | 类型 | 描述 |
|---|---|---|
modality |
字符串 | 数据模态类型,包括 image_caption、audio_caption、video_caption、lidar、imu、control |
caption |
字符串 | 文本标签(对于 control 模态,为解析后的传递函数参数,以 JSON 格式存储) |
source |
字符串 | 数据来源的上游数据集名称(如 flickr8k、audiocaps 等) |
data |
二进制 | 一个或多个命名 numpy 数组,通过 numpy.savez 打包,包含形状和数据类型等自描述信息 |
meta |
字符串 | 额外的标量参数,以 JSON 格式存储(如 sample_rate),可为空 |
data 字段可通过 numpy.load 结合 BytesIO 包装器进行解包(或使用 kairos.dataset.unpack_multimodal_data 函数),返回一个命名数组字典。例如,image_caption 模态对应 {"image": (H,W,3) uint8},control 模态对应 {"action": (T,) float32, "state": (T,) float32}。数据的具体形状取决于源样本的实际内容,不预设统一尺寸。
数据来源
数据集包含多个上游数据源的小型切片,并进行了大幅度的降采样处理(具体大小可参考构建脚本)。数据来源包括:
- Flickr8k:图像描述数据集
- AudioCaps:音频描述数据集
- Molmo2-VideoCapQA (allenai):视频问答数据集
- nuScenes-mini:自动驾驶场景数据集(含激光雷达数据)
- MotionSense:传感器数据(含 IMU 数据)
- PixelBytes-OptimalControl:最优控制数据(含状态/动作对)
视频片段在构建时从 AI2 的公共 GCS 镜像下载,并非直接托管在该数据集中。
许可与规模
- 许可证:MIT 许可
- 数据集规模:样本数小于 1K(
n<1K)




