skill-call-vision-full
收藏资源简介:
Vision-First Atomic Skill-Call Annotations (full set)是一个跨领域的结构化视频技能调用标注数据集。该数据集通过视觉语言模型(Claude Opus 4.8)观看视频,将其总结为有序的、无时间戳的结构化技能调用序列,使用统一的41技能库。技能调用包含命名的动作和类型化的参数(可能为列表值)。数据集覆盖三个领域:机器人操作(1000个视频,来自RoboInter)、烹饪(1000个视频,来自wikiHow)和通用教学视频(1053个视频,来自HowTo100M/DenseStep2M),总计约3053个视频。每个视频的标注以JSON格式存储,包含技能调用列表、整体描述、视频时长、采样帧数等信息。技能调用使用封闭的4类型系统(实体/位置/工具/参数),主要操作对象始终为object。标注过程包括对抗性批评验证,以消除视觉上无支持的调用。数据集仅包含标注,不包含源视频,适用于视频分类、动作识别、机器人技能学习、教学视频理解等任务。标注采用CC BY-NC-SA 4.0许可证,非商业用途,需相同方式共享。
Vision-First Atomic Skill-Call Annotations (full set) is a cross-domain structured video skill-call annotation dataset. This dataset utilizes the vision-language model Claude Opus 4.8 to analyze videos, summarizing them into an ordered, timestamp-free structured skill-call sequence using a unified 41-skill library. Each skill call comprises named actions and typed parameters, which may take list values. The dataset covers three domains: robotic manipulation (1000 videos sourced from RoboInter), cooking (1000 videos sourced from wikiHow), and general instructional videos (1053 videos sourced from HowTo100M/DenseStep2M), totaling approximately 3053 videos in all. Annotations for each individual video are stored in JSON format, including skill call lists, overall descriptions, video duration, sampled frame counts, and other relevant metadata. Skill calls follow a closed 4-type system (entity/location/tool/parameter), with the primary operational object consistently being "object". The annotation procedure incorporates adversarial critique validation to eliminate skill calls unsupported by visual evidence. The dataset solely contains annotations rather than the source videos, and is applicable to tasks including video classification, action recognition, robotic skill learning, instructional video understanding, and more. The annotations are licensed under CC BY-NC-SA 4.0, permitting non-commercial use with the requirement that adaptations be shared under the same license.
数据集概述
该数据集名为 “Vision-First Atomic Skill-Call Annotations (full set)”,是一个大规模、跨领域的视频结构化标注数据集。它使用视觉语言模型(VLM)自动将视频内容总结为有序的、无时间戳的技能调用序列,这些调用基于一个统一的41种技能的代码库。
核心目标
- 统一跨领域动作表示:将来自不同领域的视频(机器人操作、烹饪、通用教学视频)中的复杂动作,用一套共享的、原子化的41种技能代码库来描述。
- 结构化的技能调用:每个技能调用是一个带有类型化参数的命名动作(例如
grasp(object="clear glass jar")),关注对象、位置、工具等角色。
数据集构成
| 来源目录 | 领域 | 视频数量 |
|---|---|---|
robointer/ |
机器人操作 | 1,000 |
full18k/ |
烹饪 (wikiHow) | 1,000 |
howto100m/ |
通用教学视频 | 1,053 |
- 总规模:约3,053个视频,属于 1K-10K 范围。
- 唯一代码库:
skill_library.json,包含 41 种技能 / 11 个核心动作的定义和角色签名。 - 核心数据文件:
<source>/calls.vision.jsonl,每个视频对应一行JSON,包含VLM生成的技能调用序列。
数据生成方法
- 视频采样:对于每个视频,从整个视频中均匀采样约10-18帧。
- VLM摘要:将采样帧输入给 Claude Opus 4.8(视觉模型),要求其生成一个从41种技能库中选出的有序技能调用列表,并命名具体的对象。
- 对抗性批评:一个二次批评通道重新审视相同帧,并剔除任何缺乏视觉证据(幻觉/误读)的调用,仅保留能通过“之前→之后”状态变化证实的动作。每个调用附带一行
evidence描述。
数据架构 (calls.vision.jsonl)
每条JSON记录包含:
- 视频元数据:
video(文件名),source(来源域),duration,n_frames - overall:VLM对整个视频的文字总结。
- skills:技能调用列表,每条调用包含:
order:顺序编号。skill和core:技能名称和核心动作分类。args:参数,使用一个封闭的4类型系统(entity/location/instrument/parameter),关键角色是object。call:完整的调用字符串。evidence:支持该调用的视觉证据描述。verify_dropped:记录被批评阶段剔除的调用。
质量检查
自带离线质量检查工具,位于 qa/ 目录下。该工具无需服务器,下载后直接在浏览器中打开。可为每个标注视频显示:
- VLM所见帧的蒙太奇条。
- 生成的技能调用及其证据。
- 被批评阶段剔除的调用。
- 按“零调用 / 未审核 / 有标记”筛选,并提供视频级的“✓/✕”标记功能。
许可与版权
- 标注数据许可:CC BY-NC-SA 4.0(以最严格的原始上游许可条款为准)。
- 原始视频来源:不重新分发原始视频。用户需从上游项目获取视频,并遵守其各自的许可条款:
- RoboInter:CC BY-NC-SA 4.0
- atomiclm (Joshua0522/atomiclm):上游为 Apache-2.0
- HowTo100M / DenseStep2M:遵循YouTube使用条款
- 使用限制:非商业用途,需署名相同方式共享。权利持有者可通过讨论请求移除内容。
注意事项
- 标注进行中:由于受限于Claude Code Opus 4.8订阅的速率限制,数据集是逐步填充的。某个视频如果从
calls.vision.jsonl中缺失,表示尚未处理到(或视频本身损坏)。 - 自动生成,未经人工审计:所有标注均为机器生成。





