遇见数据集

mono-india-workplace-sample

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

World Archive Mono — India Workplace Egocentric Manipulation 数据集是一个来自World Archive的公共评估样本,专注于真实印度工作环境中的以自我为中心(第一人称视角)操作任务。该数据集旨在为操作策略、视觉语言动作(VLA)和世界模型的训练与评估提供高质量、标注密集且法律合规(已获商业AI训练许可)的数据源,弥补了现有公共数据集(如Ego4D、实验室遥操作数据)在任务类型和地理分布(特别是全球南方真实体力劳动场景)上的代表性不足。数据集包含9个视频片段(clips)和218个人工审核的动作片段(segments,中位时长12.0秒),涵盖了多个垂直领域,如穿梭管包装、工业缝纫、热风枪批量处理、服装熨烫与包装、商业餐饮、藤条编织、汽车美容、底漆与喷漆、凹陷修复与打磨等。每个视频片段都配备了完整的标注栈,包括:时间化的动词-名词动作片段及操作员注释、自然语言任务描述、每帧的21关节手部关键点(2D地标,区分左右手)、基于片段的物体边界框与跟踪ID、独立的手部边界框、推导出的手-物体接触样本,以及设备、安装方式、许可、SHA256、CI标志等元数据和质量保证信息。标注来源透明:动作片段和描述为人工标注;手部关键点和边界框为模型生成(MediaPipe估计的2D关键点)。数据集提供多种格式:1) 本仓库的元数据索引(Parquet格式的片段和动作片段表);2) 机器人就绪的LeRobot格式镜像(包含46,436帧@15fps的观测图像、手部状态(126维)和任务信息);3) 完整的视频文件及密集的JSONL标注文件包(约19 GB)。数据捕获流程规范,包括在合作站点使用头戴式自我中心设备进行管理式采集、事先获取商业AI训练同意、匿名化处理(去除音频和PII/人脸)、多层标注以及最终的人工质量验证。该数据集适用于机器人学习、以自我为中心的视频理解、物理AI和视觉语言动作模型研发等任务。需要注意的是,本样本仅限于印度工作场所,采用单目自我中心视角(多视角/腕戴/IMU数据在专业版试点中提供),物体边界框采样率约为1Hz而非每帧密集标注,且手部关键点为估计的2D点而非度量3D。样本在CC BY-NC 4.0许可下发布,用于商业或生产训练需获取单独的付费许可。

创建时间:
2026-06-25
搜集汇总
数据集介绍
mono-india-workplace-sample 数据集图片
构建方式
该数据集源自World Archive项目,专注于采集印度真实经济场景中的自我中心操作视频。数据采集采用受控合作站点模式,由工人在签署商业AI训练同意书后,佩戴头戴式智能手机支架进行第一人称视角录制。采集场景涵盖了工厂包装、工业缝纫、热缩管批处理、服装熨烫、商业餐饮、藤编、汽车精洗、底漆喷涂及钣金锉磨等九类典型工种,共计9个片段,总时长约48分钟。每个片段均经过完整的人工标注与质量审核流程,包括基于人类评审的动作-物体阶段标注、手部关键点检测、目标边界框、手-物接触事件、自然语言描述以及元数据记录。标注来源清晰可辨:动作阶段与描述来自人工审核,关键点与边界框则源自模型生成并附带来源字段。全量数据以MP4视频与JSONL标注文件形式存储于S3存储桶中,同时在Hugging Face平台上提供了轻量级元数据索引与LeRobot镜像数据集。
特点
该数据集最显著的特点在于其填补了工业与服务经济中自我中心操作数据的地理与场景空白。不同于现有公开数据集多聚焦于西方家庭厨房环境或实验室遥操作,该数据集敏锐地捕捉了印度工厂、餐厅、路旁作坊与维修车间中的真实手工操作。在标注密度上,数据集提供了丰富多样的标注层级:除基础的218个经过人工审核的动作-名词阶段外,还包含了每帧21个关节的手部关键点、稀疏采样的目标边界框、手-物接触事件、自然语言描述以及商业AI训练同意文档。特别值得一提的是,数据集原生支持LeRobot格式,可直接用于模仿学习与机器人策略训练。此外,数据集对标注来源的透明披露、质量检查通过率以及详尽的元数据记录,共同构成了其高度可靠与专业化的数据特性。
使用方法
数据集的调用灵活且多层次,可适应不同研究需求。最简洁的方式是利用Hugging Face `datasets`库加载元数据索引:通过`load_dataset`函数指定'clips'或'segments'配置即可快速获取片段摘要与动作阶段信息。对于需要直接进行策略学习的研究工作,推荐使用LeRobot数据集镜像:通过`LeRobotDataset`接口直接加载,可获取包含自我中心图像、126维状态向量及任务标签的标准化帧数据。而面向深度视觉与密集标注研究的用户,可通过AWS CLI无签名请求同步全量MP4视频与JSONL标注文件至本地,获取手部关键点、目标边界框、接触事件及自然语言描述等丰富信息。Hugging Face还提供了交互式数据探索器,支持在不同标注层间切换预览,极大便利了数据质量审查与定性分析。
背景与挑战
背景概述
在具身智能与机器人学习领域,自我中心视角的操作数据是训练视觉-语言-动作模型与模仿学习策略的关键资源。然而,现有大规模自我中心数据集如Ego4D多聚焦于西方日常生活场景,缺乏对真实工业与服务经济的深度覆盖。World Archive Mono — India Workplace Egocentric Manipulation数据集由World Archive机构于2026年创建,核心团队包括Shubham与Dheeraj等研究人员,旨在填补印度实体经济中工厂、厨房、维修车间等场景的精细操作数据空白。该数据集包含9段来自真实印度工作场所的自我中心视频片段,配备218个经人工审核的动词-名词动作片段、手部关键点、目标边界框及接触标注,并原生支持LeRobot格式,为物理AI领域的策略迁移与跨分布泛化研究提供了独特的评估基准。
当前挑战
该数据集所解决的领域核心挑战在于:当前操作策略训练数据高度偏向西方厨房与实验室遥操作场景,导致模型在印度实体经济中工厂包装、工业缝纫、藤编等非结构化工业任务上的泛化能力严重不足。这一地理与职业分布的多样性瓶颈限制了具身智能在真实全球经济中的部署。在数据集构建过程中,挑战同样严峻:首先,需在管理合作站点(非众包应用)部署头戴式手机设备,确保工人同意商业AI训练并完成文档化授权;其次,手工标注218个动作片段与多模态标注层(手部关键点、接触事件)需兼顾高密度与领域准确性;此外,9段视频的样本规模虽适于评估,却不足以支持大规模预训练,且单目配置缺少腕部相机、深度与IMU传感器,限制了三维姿态重建的精度。
常用场景
经典使用场景
该数据集专为视觉-语言-动作(VLA)模型训练与评估而设计,其核心用途在于提供来自印度真实经济场景的以自我为中心的操纵视频片段。每条视频均配备了精细的时序动作分割标注,涵盖动词-名词相位,并融合了手部关键点、目标边界框以及手-物接触信息,从而为模仿学习、策略学习与世界模型构建提供了高密度的、机器人可直接使用的标注信号。研究者可藉此开展从人类自我中心演示到机器人策略迁移的跨具身学习研究,尤其适合评估模型在面对工厂、餐厅、修理车间等非结构化工业环境时的泛化能力。
实际应用
在实际应用中,该数据集直接服务于工业与服务业的机器人自动化培训与评估。开发人员可基于其LeRobot镜像格式,快速构建并微调模仿学习策略,例如在工厂产线中学习包装、缝纫、批处理等精细操作,或在餐厅后厨掌握便当打包、烤炉操作等技能。此外,数据集内置的QA标志与商业AI训练许可文件,使得企业与研究机构能够在合规框架下将其集成至智能监控制造执行系统(MES)、工人辅助工具或人机协作平台的研发流程中,实现从数据采集到策略部署的全链路闭环。
衍生相关工作
基于该数据集的结构与理念,已衍生出一系列相关资产与工作:首先,其LeRobot镜像数据集(mono-india-workplace-lerobot)为直接基于物理-AI框架的策略学习提供了标准化接口,推动自我中心演示在模仿学习社区的标准化使用。配套发布的技术备忘录与深度博文,如《标签密度优势:真正训练策略的每分钟标注量》详细论述了高密度标注对于机器人策略训练的关键作用。此外,项目网站(factory.worldarchive.co)与数据探索器(HF Space)使研究者能够交互式浏览多层标注叠加效果,进一步催生了针对印度真实经济操纵场景的手部关键点估计、目标跟踪以及跨具身迁移等方向的研究工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务