遇见数据集

industrial_manipulation_egocentric_sample

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

该数据集是工业操作任务的第一人称视频样本,由工人在实际生产轮班期间佩戴头戴式摄像机录制而成。视频内容涵盖变形材料(如布料)和金属(如钣金)的操作过程,任务包括处理、包装和重新包装等。数据集包含16个视频片段,总时长8分14秒,每个片段分辨率为1920×1080,帧率30fps,以MP4(H.264)格式存储,无音频。元数据存储于 metadata.csv 文件中,每条记录包含自然语言描述的任务描述、材料类别、时长和操作结果。注意:本数据集仅为样本,不提供动作标签、末端执行器姿态、关节状态、手部姿态标注、力或触觉数据、深度信息、相机内参或标定数据。所有视频中的人脸已模糊处理以保护隐私。该数据集的采集过程为非脚本化的真实工业场景,具有较高的可变性、遮挡和失败案例。更广泛的完整收集还包含同步的腕部摄像机视图(可申请获取)。数据集采用 CC BY-NC 4.0 许可,非商业学术研究可免费使用,商业使用需单独联系授权。适用于视频分类、机器人操作学习、人类视频预训练、潜在动作模型等研究方向。

This dataset consists of first-person video samples of industrial manipulation tasks, recorded by workers wearing head-mounted cameras during actual production shifts. The video content covers manipulation of deformable materials (e.g., fabric) and metals (e.g., sheet metal), including tasks such as handling, packaging, and repackaging. The dataset includes 16 video clips with a total duration of 8 minutes and 14 seconds. Each clip has a resolution of 1920×1080, a frame rate of 30 fps, is stored in MP4 (H.264) format, and contains no audio. Metadata is stored in a metadata.csv file, where each record includes a natural language task description, material category, duration, and operation outcome. Note: This dataset is only a sample and does not provide action labels, end-effector poses, joint states, hand pose annotations, force or tactile data, depth information, camera intrinsics, or calibration data. All faces in the videos have been blurred to protect privacy. The dataset was collected in non-scripted real industrial environments, featuring high variability, occlusions, and failure cases. A more comprehensive collection also includes synchronized wrist camera views (available upon request). The dataset is licensed under CC BY-NC 4.0, free for non-commercial academic research, with commercial use requiring separate authorization. It is suitable for research directions such as video classification, robot manipulation learning, human video pretraining, and latent action models.

创建时间:
2026-09-04
原始信息汇总

工业操作 — 第一视角视频(样本集)

数据集概述

本数据集是工业操作任务的第一视角视频样本,由工人在真实生产轮班期间佩戴头戴式摄像头录制,涵盖可变形材料和金属处理操作。该样本集包含16个视频片段,总时长8分14秒,主要用于判断视频素材对研究工作的实用性。

技术规格

项目 详情
摄像头 头戴式,DJI Osmo Action 5 Pro
分辨率 1920×1080
帧率 30 fps
格式 MP4 (H.264)
音频 已移除
元数据 metadata.csv 提供每片段任务描述(自然语言)、材料类别、时长和结果

内容说明

  • 收录范围:视频仅包含单目RGB图像,无深度信息;无动作标签、末端执行器位姿、关节状态或手部姿态标注;无力觉或触觉数据;无相机标定或内参。
  • 样本局限:本样本仅含头戴相机视角。完整收集库中包含同步腕部相机视图,可联系获取。
  • 拍摄背景:视频由工人在正常轮班期间佩戴头戴式摄像头录制,任务并非为拍摄而刻意安排,包含真实工作中的变异性、遮挡和失败案例。

数据收集

  • 来源:工业设施内的真实工作场景。
  • 更广泛领域:布料可变形材料处理、钣金加工、包装和再包装。
  • 生产能力:目前约每周100小时视频,可扩展。

许可与隐私

  • 许可证:CC BY-NC 4.0,学术及非商业研究免费使用,需注明出处;商业使用需另行授权。
  • 隐私处理:人脸已模糊处理。

未来计划

  • 计划新增方向:基于现有视频提取手部姿态和轨迹的动作标签接触力数据(被多人反馈为对可变形和金属处理最重要的数据)。
  • 欢迎视频预训练、世界模型、潜在动作模型或人类视频学习领域的研究者提供使用反馈。

联系与引用

  • 联系:Sovrano AI,robotics@sovrano.ai,https://sovrano.ai/robotics
  • 引用信息:详见数据集中提供的BibTeX格式引用条目。
搜集汇总
数据集介绍
industrial_manipulation_egocentric_sample 数据集图片
构建方式
该数据集源自工业环境中真实生产轮班期间工人佩戴头戴式相机所采集的影像,涵盖了变形材料与金属处理等操作任务,非刻意编排,忠实再现了生产现场的动态变化、遮挡及故障情形。数据以16个视频片段组成,总时长8分14秒,分辨率达1920x1080,帧率30fps,编码为MP4(H.264),并去除音频以保护隐私。每个片段附带自然语言任务描述、材料类别、持续时间及结果等元数据,存储于metadata.csv中。采集范围还包含布料操作、钣金加工及打包再包装等多领域,现产能约每周100小时,可规模化扩展。
特点
该数据集的核心特征在于其真实性与原生性,视频记录完全源于实际生产流程,无任何摆拍或表演成分,能够真实反映工业操作中的复杂性与不确定性。数据仅含单目RGB视频,无动作标签、力觉或触觉信息及深度数据,亦无相机标定参数,这使其成为研究无监督或自监督学习的理想起点。样本中仅包含头戴视角,但完整版数据可提供同步腕部相机视图,以满足多视角研究需求。所有视频均经匿名化处理,人脸模糊,且遵循CC BY-NC 4.0许可,学术与非商业用途免费,商业用途需另行授权。
使用方法
数据集适用于视频预训练、世界模型、潜在动作模型以及从人类视频中学习等研究方向。使用者可加载MP4视频文件及metadata.csv中对应的自然语言描述,进行自监督特征提取、动作识别、轨迹预测等任务。由于缺少标注,研究者可借助无监督或弱监督方法挖掘视频中的操作模式。商业用途需联系数据提供方获取单独许可。数据提供方积极征求反馈,以决定是否添加动作标签或接触力等标注,使用者可通过指定联系方式分享建议。
背景与挑战
背景概述
在智能制造与机器人技术深度融合的时代背景下,从人类操作视频中学习复杂操作技能已成为具身智能领域的研究前沿。该数据集由Sovrano AI团队于2026年创建,聚焦于真实工业场景中的第一人称操作视频,涵盖布料等可变形材料与金属板材处理等非脚本化任务。其核心研究问题在于,通过头戴式设备采集的16段高清视频样本,探索从无标注人类操作视频中获取技能表征的可行性,为视频预训练、世界模型及潜在动作模型等方向提供基准数据。该数据集的发布填补了工业真实场景中可变形物体操作数据稀缺的空白,对推动学习型机器人从仿真到现实迁移具有重要参考价值,亦为研究非结构化环境下的操作泛化提供了实证支撑。
当前挑战
该数据集面临的挑战兼具领域深度与构建复杂度。在领域问题层面,当前机器人操作学习主要受限于图像分类等基础任务的标注范式,难以应对可变形物体(如布料)与金属交互中的高维物理动态,且视频预训练方法在缺乏手部姿态、力觉及深度信息时,难以有效推断潜在动作序列,制约了从人类视频到机器人控制策略的迁移效率。在构建过程中,采集于真实生产轮班的非脚本视频引入了显著的光照骤变、工具遮挡与任务失败案例,而头戴视角的剧烈运动加剧了时序对齐难度;同时,匿名化处理(人脸模糊)与多相机同步(腕部视角)的技术整合,以及约100小时/周的规模扩展要求,均对数据清洗、元数据标注与场景泛化性构成了严峻考验。
常用场景
经典使用场景
该数据集为工业操作场景下的自我中心视频样本,捕捉了工人在真实生产轮班中进行的可变形材料与金属处理任务。其经典使用场景聚焦于机器人学习领域,尤其是从人类视频中学习操作技能。研究者可利用这些头戴式摄像头录制的无脚本视频,训练视觉运动策略、动作识别模型或进行无监督表示学习,以理解工业操作中的手-物交互与任务序列。
衍生相关工作
该数据集的衍生工作可能涵盖基于自我中心视频的手部姿态估计、轨迹提取以及接触力预测模型的发展。其采集基础设施支撑了大规模视频数据的持续增长,为视频预训练和跨视角学习(如头戴相机与腕部相机协同)提供了基准。数据集的开放许可鼓励非商业研究社区开发新的学习范式,例如用于机器人操作的无监督策略学习,并可能催生从操作结果标签中推断奖励函数的创新方法。
数据集最近研究
最新研究方向
在机器人学习与具身智能研究的前沿,从人类视频中提取操作技能已成为突破数据瓶颈的关键路径,而当前工业场景的开放性数据依旧稀缺。该数据集以真实产线上工人头戴视角的未剪辑操作片段为核心,涵盖布料形变操作、金属薄板加工及包装等复杂任务,直面遮挡、失败案例和自然变异性,为视频预训练、世界模型及潜动作模型等范式提供了宝贵的学习样本。其样本虽小,却明确指向两个高价值方向:通过手部姿态与轨迹提取生成动作标签,以及建模接触力信息以服务形变体操作,这标志着学界对物理交互深层理解的不懈追求。该数据集的出现,不仅补全了从仿真到真实、从实验室到车间的重要环节,更可能推动具身智能在工业场景中的泛化应用,为构建可感知、能推理的自主操作智能体注入关键数据动能。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务