RobotDesign1M
收藏资源简介:
RobotDesign1M是一个用于机器人设计理解的大规模多模态数据集,旨在解决机器人设计领域缺乏大规模基准数据的问题,以支持设计感知基础模型的研究,例如设计图像生成、关于机器人设计的视觉问答以及设计图像检索。数据集样本来源于广泛的机器人学领域的科学文献,每个样本均包含一个机器人设计图像及其关联的文本信息。文本信息以两种形式提供:一种是直接的图像描述(image captions),另一种是用于视觉指令调优的多轮问答对话(multi-turn question–answer dialogs)。数据集包含两个主要配置:conversations 配置侧重于多轮对话数据,包含约309万训练样本、38.7万验证样本和38.7万测试样本;image_caption 配置侧重于图像描述数据,包含约447万训练样本、55.9万验证样本和55.9万测试样本。所有样本均包含图像模态。该数据集可用于推动机器人设计的自动化生成、基于文本的设计示例检索以及AI辅助设计工具等应用。
RobotDesign1M is a large-scale multimodal dataset for robot design understanding, aimed at addressing the lack of large-scale benchmark data in the field of robot design to support research on design-aware foundational models, such as design image generation, visual question answering about robot designs, and design image retrieval. The dataset samples are sourced from a wide range of scientific literature in robotics, with each sample containing a robot design image and associated textual information. The textual information is provided in two forms: direct image captions and multi-turn question-answer dialogs for visual instruction tuning. The dataset includes two main configurations: the conversations configuration focuses on multi-turn dialog data, containing approximately 3.09 million training samples, 387,000 validation samples, and 387,000 test samples; the image_caption configuration focuses on image caption data, containing approximately 4.47 million training samples, 559,000 validation samples, and 559,000 test samples. All samples include the image modality. This dataset can be used to advance applications such as automated generation of robot designs, text-based design example retrieval, and AI-assisted design tools.
RobotDesign1M 数据集概览
基本信息
- 数据集名称:RobotDesign1M
- 发布机构:FPT Software AI Center 等多个机构
- 许可证:MIT
- 发表会议:IROS 2026
- 论文链接:https://arxiv.org/abs/2503.06796
- 项目页面:https://airvlab.github.io/robotdesign1m/
数据集简介
RobotDesign1M 是一个大规模多模态数据集,专注于机器人设计理解。数据来源于科学文献中的图像-文本对,覆盖广泛的机器人领域。该数据集旨在支持设计感知基础模型的研究,包括设计图像生成、关于设计的视觉问答以及设计图像检索。
数据构成
每个样本将机器人设计图像与相关文本关联,文本形式包括:
- 图像描述(image captions)
- 多轮问答对话(multi-turn question-answer dialogs),用于视觉指令微调
数据划分与规模
1. conversations 配置
| 划分 | 样本数 | 数据大小 |
|---|---|---|
| 训练集(train) | 3,097,740 | ~351.8 GB |
| 验证集(val) | 387,217 | ~44.0 GB |
| 测试集(test) | 387,219 | ~44.0 GB |
| 总计 | 3,872,176 | ~439.8 GB |
2. image_caption 配置
| 划分 | 样本数 | 数据大小 |
|---|---|---|
| 训练集(train) | 4,479,798 | ~515.0 GB |
| 验证集(val) | 559,974 | ~64.4 GB |
| 测试集(test) | 559,976 | ~64.4 GB |
| 总计 | 5,599,748 | ~643.7 GB |
数据特征
- image:图像数据
- dialogs:对话数据,包含用户提问(user)和助手回答(assistant),均为字符串类型
应用场景
- 机器人设计图像生成
- 机器人设计视觉问答
- 机器人设计图像检索




