遇见数据集

robointer-skill-annotations

收藏
Hugging Face2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

RoboInter原子技能片段标注数据集(AutoMark)是一个专门针对机器人操作视频的原子技能片段标注数据集,由AutoMark项目整理。该数据集基于InternRobotics/RoboInter-Data数据集派生,但仅包含标注信息,不包含原始视频文件。每个机器人操作片段被分割为原子原始技能区间(如拾取、放置、倾倒),并配有以秒为单位对齐的时间戳和动词(对象)风格的目标调用描述,覆盖15个标签的RoboInter原始技能分类法。数据集规模包含235,880个片段(主/外部摄像头)和758,397个原子技能片段标注,源帧率为10.0 FPS。技能分类法包括:转移、拾取、放置、按压、推、拉、扭转、倾倒、折叠、滑动、插入、摇晃、敲击、抛掷、操纵。数据集文件包括完整的文件夹标注文件(annotation.json)、用于技能/调用预测的文本评估行(qwen/text.jsonl)、包含视频路径的视觉烟雾测试子集(qwen/visual_smoke_1024.jsonl)以及构建报告(qwen/report.json)。该数据集适用于机器人技能分割、视频理解、技能识别等任务,采用CC BY-NC-SA 4.0许可,仅限非商业使用。

RoboInter Atomic Skill Segment Annotation Dataset (AutoMark) is a specialized annotation dataset for atomic skill segments in robot manipulation videos, curated by the AutoMark project. Derived from the InternRobotics/RoboInter-Data dataset, this dataset only contains annotation information and excludes the original video files. Each robot manipulation segment is divided into atomic raw skill intervals such as picking, placing, pouring, and paired with second-aligned timestamps and verb-(object) style goal invocation descriptions, covering the 15-label RoboInter raw skill taxonomy. The dataset includes 235,880 segments (main/external cameras) and 758,397 atomic skill segment annotations, with a source frame rate of 10.0 FPS. The skill taxonomy includes: transfer, pick, place, press, push, pull, twist, pour, fold, slide, insert, shake, tap, throw, manipulate. The dataset files consist of the complete folder annotation file (annotation.json), text evaluation lines for skill/goal prediction (qwen/text.jsonl), a visual smoke test subset containing video paths (qwen/visual_smoke_1024.jsonl), and a construction report (qwen/report.json). This dataset is applicable to tasks including robot skill segmentation, video understanding, and skill recognition, and is licensed under CC BY-NC-SA 4.0 for non-commercial use only.

创建时间:
2026-06-02
原始信息汇总

数据集概述

RoboInter Atomic-Skill Segment Annotations (AutoMark) 是一个仅包含标注信息的数据集,由 AutoMark 项目整理,用于机器人操作视频的原子技能片段分割。

核心信息

  • 数据集规模:包含 235,880 个视频片段(主摄像机/外部摄像机),共计 758,397 条原子技能片段标注。
  • 技能标签:采用 RoboInter 原始技能分类体系,共 15 种标签transfer, pick, place, press, push, pull, twist, pour, fold, slide, insert, shake, strike, throw, manipulate
  • 时间精度:源视频帧率为 10.0 FPS,标注时间戳精确到秒级别。

文件结构

文件名 说明
annotation.json 完整数据集标注文件,包含顶级元数据(技能分类、帧率、计数)和 videos[] 列表。每个视频包含 file_namefpssourcedroid / rh20t)、source_member_path 以及 annotations[] 列表。每条标注包含 startendframe_startframe_endskillcallverb(args) 格式)和 text
qwen/text.jsonl 758,397 行纯文本评估数据,每行对应一个技能片段,包含 textgt_skilltarget_callallowed_skillsprompt
qwen/visual_smoke_1024.jsonl 1,024 行的视觉烟雾测试子集,增加了相对路径 video_pathvideo/<video_id>.mp4),用于与单独获取的视频文件对应。
qwen/report.json 构建报告,包含行数和技能分类计数。

数据来源与许可

  • 来源:标注源自 RoboInter-Data(访问需接受其社区许可和隐私政策),该数据集基于 DROIDRH20T 构建。
  • 许可协议CC BY-NC-SA 4.0(非商业用途,衍生作品需采用相同许可,需注明 RoboInter、DROID 和 RH20T 出处)。

重要提示

  • 本数据集仅包含标注信息,不包含原始视频file_name / video_path 字段是 RoboInter 视频标识符,并非重新分发的媒体文件。若需获取实际 .mp4 视频,需单独申请访问 RoboInter-Data 并使用 AutoMark 导出的脚本重建。
搜集汇总
数据集介绍
robointer-skill-annotations 数据集图片
构建方式
该数据集源自AutoMark项目,旨在为机器人操作视频提供原子技能段落的标注信息。数据集的构建基于RoboInter-Data中的原始视频,通过自动化的原子技能归纳算法,将每个机器人操作片段按照15种原始技能标签(如pick、place、pour等)进行时间对齐的分割,生成以秒为单位的起止时间戳及verb(object)格式的函数调用目标。需要注意的是,本数据集仅包含标注结果,不包含原始视频文件,用户需通过访问RoboInter-Data获取视频并借助AutoMark脚本重建完整数据。
特点
数据集涵盖235,880个操作片段和758,397条原子技能标注,规模可观且标注粒度精细。其技能分类体系包含15种机器人原始操作,覆盖转移、抓取、放置、按压、推拉、扭转、倾倒等常见动作,能够有效支撑细粒度的技能分割与识别任务。数据集的标注以JSON形式组织,每条标注包含起止时间、起止帧号、技能标签及函数调用文本,便于下游模型直接使用。此外,还提供了纯文本和视觉样本两种评估子集,适配不同的评测需求。
使用方法
用户可通过加载annotation.json文件获取完整的标注数据,其中视频字段包含了文件名、来源(droid或rh20t)及内部路径,便于与原始视频对应。针对技能预测任务,qwen/text.jsonl提供了每段文本描述对应的真实技能标签和允许技能列表,适合用于基于语言模型的技能分类评估。若需结合视觉信息,可使用qwen/visual_smoke_1024.jsonl子集,其中包含视频相对路径及相同的标注结构。数据集采用CC BY-NC-SA 4.0许可,仅限非商业用途,使用时需注明RoboInter、DROID和RH20T的出处。
背景与挑战
背景概述
在机器人操作领域,将复杂的任务分解为原子化的技能片段是提升机器人自主学习与泛化能力的关键步骤。RoboInter Atomic-Skill Segment Annotations(AutoMark)数据集由AutoMark项目团队于近年创建,旨在为机器人操作视频提供精细的原子技能分割标注。该数据集基于RoboInter-Data构建,并整合了DROID与RH20T两大公开数据集的视频资源,涵盖了从抓取、放置到倾倒等15种基本操作技能。通过提供超过23万条视频片段与75万条技能分割标注,该数据集为机器人技能学习、视频理解及策略泛化研究提供了标准化基准,有力推动了机器人从演示中学习原子操作技能的研究进程。
当前挑战
该数据集所面临的核心挑战在于,机器人操作视频的语义复杂性使得技能边界的精确界定成为难题。不同于简单的图像分类,机器人操作涉及连续动作与动态环境,不同技能间的过渡往往模糊且依赖上下文,这要求标注方法具备高度的鲁棒性与一致性。此外,数据集的构建过程本身亦颇具挑战:原始视频来源于DROID和RH20T等异构数据集,其采集视角、执行器差异及操作风格的不统一,增加了技能分割的难度。模型需在无需人工干预的条件下,自动识别并标注出原子技能片段,同时处理缺失对象绑定信息及时间戳对齐等问题,这对规则解析与合成标注算法的精度提出了严苛要求。
常用场景
经典使用场景
在机器人学习与视频理解交叉领域,该数据集被广泛应用于细粒度的原子技能分割任务,旨在将长达数分钟的机器人操作视频精准切分为若干具有语义一致性的基础动作片段,如抓取、放置、倾倒等。研究者常利用其提供的15类原子技能标签及秒级对齐的时间戳,训练或评估视频理解模型在连续动作序列上的时序定位能力。这种时序分割不仅是视频内容分析的关键步骤,更为机器人从人类演示中学习操作策略提供了结构化的训练素材。
衍生相关工作
基于该数据集催生了一系列重要研究成果,最具代表性的是其衍生项目AutoMark所提出的在线原子技能归纳框架,该框架通过规则化解析与模板匹配自动生成技能片段标注,大幅降低了人工标注成本。此外,围绕该数据集还涌现出多种技能词汇学习与时序动作定位模型,例如结合语言指令与视频特征的跨模态分割方法,以及利用技能转移概率进行动作预测的时序模型。这些工作共同推动了机器人技能学习领域从数据驱动向知识驱动的范式演进。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作视频的原子技能片段注释,旨在推动机器人技能分割与理解的前沿研究。结合近期机器人领域的热点事件,如多模态大模型与具身智能的深度融合,该数据集通过提供大规模、细粒度的技能标签(如拾取、放置、倾倒等15种基本操作),为机器人从视频中自主学习和归纳可复用的操作原语提供了关键训练资源。其意义在于,通过精确的时序标注和动作-对象绑定,能够加速机器人模仿学习、技能泛化以及人机协作任务的智能化进程,为构建更灵活、泛化能力更强的机器人系统奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务