遇见数据集

skill-call-vision-full

收藏
Hugging Face2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

Vision-First Atomic Skill-Call Annotations (full set)是一个跨领域的结构化视频技能调用标注数据集。该数据集通过视觉语言模型(Claude Opus 4.8)观看视频,将其总结为有序的、无时间戳的结构化技能调用序列,使用统一的41技能库。技能调用包含命名的动作和类型化的参数(可能为列表值)。数据集覆盖三个领域:机器人操作(1000个视频,来自RoboInter)、烹饪(1000个视频,来自wikiHow)和通用教学视频(1053个视频,来自HowTo100M/DenseStep2M),总计约3053个视频。每个视频的标注以JSON格式存储,包含技能调用列表、整体描述、视频时长、采样帧数等信息。技能调用使用封闭的4类型系统(实体/位置/工具/参数),主要操作对象始终为object。标注过程包括对抗性批评验证,以消除视觉上无支持的调用。数据集仅包含标注,不包含源视频,适用于视频分类、动作识别、机器人技能学习、教学视频理解等任务。标注采用CC BY-NC-SA 4.0许可证,非商业用途,需相同方式共享。

Vision-First Atomic Skill-Call Annotations (full set) is a cross-domain structured video skill-call annotation dataset. This dataset utilizes the vision-language model Claude Opus 4.8 to analyze videos, summarizing them into an ordered, timestamp-free structured skill-call sequence using a unified 41-skill library. Each skill call comprises named actions and typed parameters, which may take list values. The dataset covers three domains: robotic manipulation (1000 videos sourced from RoboInter), cooking (1000 videos sourced from wikiHow), and general instructional videos (1053 videos sourced from HowTo100M/DenseStep2M), totaling approximately 3053 videos in all. Annotations for each individual video are stored in JSON format, including skill call lists, overall descriptions, video duration, sampled frame counts, and other relevant metadata. Skill calls follow a closed 4-type system (entity/location/tool/parameter), with the primary operational object consistently being "object". The annotation procedure incorporates adversarial critique validation to eliminate skill calls unsupported by visual evidence. The dataset solely contains annotations rather than the source videos, and is applicable to tasks including video classification, action recognition, robotic skill learning, instructional video understanding, and more. The annotations are licensed under CC BY-NC-SA 4.0, permitting non-commercial use with the requirement that adaptations be shared under the same license.

创建时间:
2026-06-28
原始信息汇总

数据集概述

该数据集名为 “Vision-First Atomic Skill-Call Annotations (full set)”,是一个大规模、跨领域的视频结构化标注数据集。它使用视觉语言模型(VLM)自动将视频内容总结为有序的、无时间戳的技能调用序列,这些调用基于一个统一的41种技能的代码库。

核心目标

  • 统一跨领域动作表示:将来自不同领域的视频(机器人操作、烹饪、通用教学视频)中的复杂动作,用一套共享的、原子化的41种技能代码库来描述。
  • 结构化的技能调用:每个技能调用是一个带有类型化参数的命名动作(例如 grasp(object="clear glass jar")),关注对象、位置、工具等角色。

数据集构成

来源目录 领域 视频数量
robointer/ 机器人操作 1,000
full18k/ 烹饪 (wikiHow) 1,000
howto100m/ 通用教学视频 1,053
  • 总规模:约3,053个视频,属于 1K-10K 范围。
  • 唯一代码库skill_library.json,包含 41 种技能 / 11 个核心动作的定义和角色签名。
  • 核心数据文件<source>/calls.vision.jsonl,每个视频对应一行JSON,包含VLM生成的技能调用序列。

数据生成方法

  1. 视频采样:对于每个视频,从整个视频中均匀采样约10-18帧。
  2. VLM摘要:将采样帧输入给 Claude Opus 4.8(视觉模型),要求其生成一个从41种技能库中选出的有序技能调用列表,并命名具体的对象。
  3. 对抗性批评:一个二次批评通道重新审视相同帧,并剔除任何缺乏视觉证据(幻觉/误读)的调用,仅保留能通过“之前→之后”状态变化证实的动作。每个调用附带一行 evidence 描述。

数据架构 (calls.vision.jsonl)

每条JSON记录包含:

  • 视频元数据video (文件名), source (来源域), duration, n_frames
  • overall:VLM对整个视频的文字总结。
  • skills:技能调用列表,每条调用包含:
    • order:顺序编号。
    • skillcore:技能名称和核心动作分类。
    • args:参数,使用一个封闭的4类型系统(entity / location / instrument / parameter),关键角色是 object
    • call:完整的调用字符串。
    • evidence:支持该调用的视觉证据描述。
    • verify_dropped:记录被批评阶段剔除的调用。

质量检查

自带离线质量检查工具,位于 qa/ 目录下。该工具无需服务器,下载后直接在浏览器中打开。可为每个标注视频显示:

  • VLM所见帧的蒙太奇条
  • 生成的技能调用及其证据。
  • 被批评阶段剔除的调用。
  • 按“零调用 / 未审核 / 有标记”筛选,并提供视频级的“✓/✕”标记功能。

许可与版权

  • 标注数据许可:CC BY-NC-SA 4.0(以最严格的原始上游许可条款为准)。
  • 原始视频来源:不重新分发原始视频。用户需从上游项目获取视频,并遵守其各自的许可条款:
    • RoboInter:CC BY-NC-SA 4.0
    • atomiclm (Joshua0522/atomiclm):上游为 Apache-2.0
    • HowTo100M / DenseStep2M:遵循YouTube使用条款
  • 使用限制:非商业用途,需署名相同方式共享。权利持有者可通过讨论请求移除内容。

注意事项

  • 标注进行中:由于受限于Claude Code Opus 4.8订阅的速率限制,数据集是逐步填充的。某个视频如果从 calls.vision.jsonl 中缺失,表示尚未处理到(或视频本身损坏)。
  • 自动生成,未经人工审计:所有标注均为机器生成。
搜集汇总
数据集介绍
skill-call-vision-full 数据集图片
构建方式
该数据集通过视觉语言模型Claude Opus 4.8对视频进行结构化技能调用标注而构建。对于每个视频片段,模型观察均匀采样自整个视频的约10至18帧画面,并依据统一的41种技能库生成有序的技能调用序列,命名所见的具象物体,而不产生描述性字幕或时间戳。随后,通过对抗性批评器对相同帧进行二次审查,删除缺乏视觉依据的调用,仅保留通过前后状态变化验证的动作。每项调用附带一行证据文本,被删除的调用则录入verify_dropped字段。
特点
数据集涵盖机器人操作、烹饪和通用操作教学三大领域,共计约3053个视频,提供了无时间戳的结构化技能调用序列作为标注。技能调用采用类型化参数系统,包含实体、位置、工具和参数四种角色类型,并以object作为主要操作对象。每个视频的标注结果包含整体描述、有序的技能调用列表及其证据,同时提供了自包含的质量检查工具,可直观对比模型所见的帧画面与生成的技能调用,支持零调用、未审查和标记视频的筛选功能。
使用方法
数据集以JSON Lines格式存储于各领域目录下的calls.vision.jsonl文件中,每一行对应一个视频的结构化标注。用户可直接读取JSON对象中的skills字段获取技能调用序列,利用skill字段与技能库中的定义关联,或使用args中的参数信息进行细粒度分析。质量检查可通过下载qa目录下的HTML页面在本地浏览器中打开,无需服务器支持。需注意数据集仅包含标注信息,源视频需从RoboInter、atomiclm和HowTo100M等上游数据集中获取,并遵守各自许可协议。
背景与挑战
背景概述
在机器人操作与教学视频理解领域,将连续视觉观测转化为结构化的原子技能调用序列是迈向通用智能体的关键一步。为此,研究团队于近年构建了skill-call-vision-full数据集,它由来自多个机构的研究者共同开发,核心目标是以视觉为先导,通过大语言模型将跨领域的视频内容统一映射为包含41种原子技能的调用记录。该数据集整合了机器人操作、烹饪及通用教学视频三大来源,共计超过3000个样本,其以无时间戳的技能列表形式描述视频,显著降低了动作表征的复杂性,为连接视觉感知与符号推理提供了标准化的桥梁,在机器人学习与视频理解领域具有深远影响力。
当前挑战
该数据集面临的挑战主要源于领域问题与构建过程两个层面。一方面,在丰富的机器人操作和日常任务视频中,如何定义既覆盖广泛动作又具备明确可操作性的原子技能库,以及如何让视觉模型准确识别并避免幻觉或误读,是核心科学难题。另一方面,构建过程中,依赖付费API对大量视频进行逐帧采样和细粒度标注,受到严格的速率限制,导致数据集的填充需经多次睡眠/重启周期缓慢完成,同时标注结果完全由机器生成,缺乏人工审核,其可信度与一致性成为亟待解决的工程挑战。
常用场景
经典使用场景
在具身智能与行为理解这一交叉领域中,skill-call-vision-full数据集为从视频中提取原子技能(atomic skill)的序列化结构化标注提供了典范。该数据集涵盖机器人操作、烹饪教学和通用操作指南三大领域,共约3,053段视频,每段视频由视觉语言模型(VLM)基于统一的41技能库,生成无时间戳的、带有类型化参数的技能调用序列。这一范式摒弃了传统视频理解中的时间戳分割与自然语言描述,转而以类似于函数调用的形式,精确定义了诸如grasp(object="clear glass jar")等操作行为,显著降低了视频语义表示的歧义性,为跨域动作识别与技能迁移研究提供了高保真的基准资源。
解决学术问题
该数据集针对的核心学术难题是视频中细粒度操作行为的结构化建模与去幻觉标注。传统视频动作识别方法往往依赖粗糙的类别标签或冗长的自然语言描述,难以捕捉操作中的对象交互与参数细节,且容易受到视频歧义性和模型幻觉的干扰。skill-call-vision-full通过引入对抗性批评机制(adversarial critic pass),对VLM生成的技能调用进行验证,剔除视觉证据不足的虚假调用,仅保留具有明确状态变化支持的原子动作,有效缓解了机器标注中的幻觉问题。这一机制为构建高可靠性、可解释的视频行为解析系统奠定了方法论基础,推动了对跨领域通用操作知识库的探索。
衍生相关工作
基于该数据集,衍生出一系列具有影响力的研究工作。首先是作为基准的skill-call-benchmark-50x3,它抽取了50段视频并邀请三位标注者进行人工验证,为评估机器标注质量提供了标尺。其次,该数据集促生了面向视觉语言模型的结构化输出评测框架,研究者可通过比较模型在不同领域上输出的技能调用序列与数据集标注的一致性,来量化模型对原子动作和参数的理解能力。此外,围绕技能库的跨域适应性,出现了一系列关于技能本体对齐、参数角色类型分类以及幻觉检测算法的研究,这些工作进一步丰富了结构化视频理解的理论体系,并推动了通用机器人操作知识库的建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务