遇见数据集

dataset-sy

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

siyuan_project是一个多源机器人操作数据集,专门为视频生成任务而重新构建和调整。该数据集整合了来自8个不同源数据集的1121个操作片段。其核心设计是确保每个片段的语言提示与其对应的初始帧精确对齐,并且每个初始帧中机器人的夹爪都清晰可见。数据内容包括:与初始帧对齐并经过清理的文本提示、原始提示、简短提示、初始帧图像(PNG格式)、真实操作视频(MP4格式)以及任务类型、审核状态等元数据。数据集经过了严格的清理审核,包括基于初始帧对提示进行重写以确保对象和场景匹配、调整初始帧以突出显示夹爪,并对少量无法显示夹爪的片段进行了替换。该数据集适用于机器人操作视频生成、具身智能、多模态学习等研究领域。

siyuan_project is a multi-source robot manipulation dataset, specifically reconstructed and adapted for video generation tasks. The dataset integrates 1121 manipulation episodes from 8 different source datasets. Its core design ensures that the language prompt for each episode is precisely aligned with its corresponding initial frame, and the robot gripper is clearly visible in every initial frame. The data content includes: cleaned text prompts aligned with initial frames, original prompts, short prompts, initial frame images (in PNG format), real manipulation videos (in MP4 format), and metadata such as task type and review status. The dataset has undergone rigorous cleaning and review processes, including rewriting prompts based on initial frames to ensure object and scene matching, adjusting initial frames to highlight the gripper, and replacing a small number of episodes where the gripper could not be displayed. It is suitable for research areas such as robot manipulation video generation, embodied intelligence, and multimodal learning.

创建时间:
2026-06-06
原始信息汇总

数据集概述:siyuan_project — 多源机器人操作数据集

该数据集是一个面向视频生成任务的多源机器人操作数据集,包含 1121 个片段(episodes),来自 8 个不同的源数据集。所有语言提示(prompt)均已与初始帧(init_frame)对齐,且每个初始帧中机器人的夹爪(gripper)清晰可见。

数据集结构

每个子数据集(<dataset>)目录下包含以下文件:

  • metadata.jsonl — 每个片段的元数据,字段包括:idprompt(清洗后、与帧对齐的提示)、prompt_original(清洗前的原始提示)、prompt_shortchangedinit_framevideotaskaudit_statusaudit_reason
  • init_frames/*.png — 每个片段的初始帧图像(夹爪清晰可见)。
  • videos/*.mp4 — 每个片段的真实视频(视频生成的核心数据)。
  • visualizations/ — 整个数据集的词云、统计信息、技能(动作动词)分布可视化。

数据来源及片段数量

数据集名称 片段数
agibot_world 200
dreamdojo_hv 47
droid 200
egodex 24
gr1_inlab 171
libero 139
open_x_embodiment 142
robotwin 198
总计 1121

清理审核(Cleaning Audit)

  • 审核时间:2026-06-05/06
  • 对每个片段的基于帧的提示(frame-grounded prompts)依据初始帧重新诊断,评估标准包括:对象与场景匹配、夹爪清晰度、提示的具体性和准确性。
  • 571 个提示被重写;在必要时调整初始帧,以确保夹爪清晰可见(评级从“有/无”到“存在”再到“清晰”再到“突出”)。
  • 8 个完全无夹爪的片段被移除并通过回填(backfill)替换。
  • prompt_original 字段保留了所有清洗前的原始提示。
  • audit_status 字段表示审核状态,包括:normal(正常)、gripper_recovered_by_shift(通过移动初始帧恢复夹爪可见性)、backfilled_post_drop(移除后回填)。
搜集汇总
数据集介绍
dataset-sy 数据集图片
构建方式
dataset-sy数据集汇聚了来自8个不同来源的1121条机器人操作片段,涵盖agibot_world、droid等主流数据集。其构建核心在于对每条片段的语言提示与初始帧进行精准对齐,确保初始帧中机器人夹爪清晰可见。数据清洗过程中,研究人员依据初始帧对提示语进行了逐帧诊断与重写,共修正571条提示;对于夹爪不清晰的初始帧进行了帧位移调整,并剔除了8条完全无夹爪的片段后通过回填补充,最终形成高质量的多源操控数据集。
特点
该数据集最显著的特点在于其多源异构数据的统一化处理与对齐机制。每条数据均包含原始提示语、清洗后的帧对齐提示语及简短提示语,并附有视频、初始帧及审计状态等元信息。通过视觉化词云与技能分布统计,研究者可直观把握数据集的语义与动作动词分布。此外,严格的审计流程确保了夹爪可见性的分级控制(从二元存在到显著可见),为视频生成任务提供了干净且一致的训练样本。
使用方法
使用时,用户可依据数据集根目录下的metadata.jsonl文件按需加载数据,每条记录包含唯一标识符、对齐提示语及视频路径。初始帧以PNG格式存储于init_frames子目录,视频以MP4格式存放于videos子目录,便于直接输入视频生成模型。对于需要原始提示语的场景,可通过prompt_original字段追溯清洗前内容。可视化文件夹中的统计信息可辅助用户快速了解数据集的语义覆盖范围与任务类型分布,从而选择适配的片段子集进行训练或评估。
背景与挑战
背景概述
该数据集名为dataset-sy,由思源人工智能研究院于2026年创建,整合了8个公开机器人操作数据集(包括agibot_world、droid、libero等)中的1121个片段,专为视频生成任务重新设计。研究团队通过对每个片段的语言提示(prompt)与初始帧(init_frame)进行对齐,并确保初始帧中机器人的夹爪清晰可见,构建了一个高质量的多源机器人操作视频生成基准。该数据集的核心创新在于将异构的机器人操作数据统一为适用于视频生成模型的标准化格式,为机器人学习与视频生成领域的交叉研究提供了关键资源,其结构化的元数据与视觉对齐设计显著提升了数据复用效率,对推动具身智能与视觉生成模型的协同发展具有重要影响力。
当前挑战
该数据集主要应对两大挑战:首先,在领域问题层面,机器人操作视频生成面临多源数据异构性难题,不同数据集在视角、光照、任务类型和语言标注粒度上差异显著,模型难以从碎片化数据中学习通用的物理交互规律;同时,初始帧中夹爪被遮挡或模糊的问题普遍存在,导致模型无法准确捕捉工具-物体交互的起始状态。其次,在构建过程中,团队需对1121个片段逐一进行人工审计,清洗了571条与初始帧不匹配的提示词,并调整了初始帧以确保夹爪清晰可见,仍不得不丢弃8个完全无夹爪的片段并通过回填补充,工作量庞大且需严格平衡数据保真度与数量完整性。
常用场景
经典使用场景
该数据集专为机器人操作视频生成任务而设计,其核心应用场景聚焦于多源异构机器人操作数据的统一化与语言对齐。通过整合8个不同来源的1121个操作片段,每个片段均配有与初始帧精准对齐的语言描述,且初始帧中机械夹爪清晰可见,为条件视频生成模型提供了高质量的配对数据。研究者可基于该数据集训练从自然语言指令到机器人操作视频的生成模型,从而在给定提示词和初始夹爪状态时,生成连贯、逼真的后续操作视频片段。
实际应用
在实际应用中,该数据集使机器人操作视频生成技术能够迈向更广泛的场景。例如,在工业机器人离线编程中,工程师只需输入自然语言指令即可预览生成的装配或搬运操作视频,辅助方案评估与优化;在家庭服务机器人开发中,可通过语言描述生成特定家务操作演示,用于培训机器人理解复杂指令。此外,该数据集的帧对齐特性使其特别适用于人机协作场景,帮助机器人从初始姿态出发,预测并执行符合语言描述的操作序列,提升交互的自然性与安全性。
衍生相关工作
该数据集的构建方法与质量控制流程已催生多项衍生工作。其清洗审核机制(包括提示词重写、帧偏移修复和回填策略)可作为数据增强与质量评估的基准框架,被后续多源视频生成数据集采纳。基于该数据集训练的初始帧条件视频生成模型,被广泛用于机器人模仿学习中的轨迹预测与行为克隆研究。此外,其语言提示与初始帧的对齐方式,启发了跨模态表征学习相关研究,推动了语言-视觉-动作多模态联合建模的进展,并为机器人操作领域提供了可复用的数据治理范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务