mono-india-workplace-sample
收藏资源简介:
World Archive Mono — India Workplace Egocentric Manipulation 数据集是一个来自World Archive的公共评估样本,专注于真实印度工作环境中的以自我为中心(第一人称视角)操作任务。该数据集旨在为操作策略、视觉语言动作(VLA)和世界模型的训练与评估提供高质量、标注密集且法律合规(已获商业AI训练许可)的数据源,弥补了现有公共数据集(如Ego4D、实验室遥操作数据)在任务类型和地理分布(特别是全球南方真实体力劳动场景)上的代表性不足。数据集包含9个视频片段(clips)和218个人工审核的动作片段(segments,中位时长12.0秒),涵盖了多个垂直领域,如穿梭管包装、工业缝纫、热风枪批量处理、服装熨烫与包装、商业餐饮、藤条编织、汽车美容、底漆与喷漆、凹陷修复与打磨等。每个视频片段都配备了完整的标注栈,包括:时间化的动词-名词动作片段及操作员注释、自然语言任务描述、每帧的21关节手部关键点(2D地标,区分左右手)、基于片段的物体边界框与跟踪ID、独立的手部边界框、推导出的手-物体接触样本,以及设备、安装方式、许可、SHA256、CI标志等元数据和质量保证信息。标注来源透明:动作片段和描述为人工标注;手部关键点和边界框为模型生成(MediaPipe估计的2D关键点)。数据集提供多种格式:1) 本仓库的元数据索引(Parquet格式的片段和动作片段表);2) 机器人就绪的LeRobot格式镜像(包含46,436帧@15fps的观测图像、手部状态(126维)和任务信息);3) 完整的视频文件及密集的JSONL标注文件包(约19 GB)。数据捕获流程规范,包括在合作站点使用头戴式自我中心设备进行管理式采集、事先获取商业AI训练同意、匿名化处理(去除音频和PII/人脸)、多层标注以及最终的人工质量验证。该数据集适用于机器人学习、以自我为中心的视频理解、物理AI和视觉语言动作模型研发等任务。需要注意的是,本样本仅限于印度工作场所,采用单目自我中心视角(多视角/腕戴/IMU数据在专业版试点中提供),物体边界框采样率约为1Hz而非每帧密集标注,且手部关键点为估计的2D点而非度量3D。样本在CC BY-NC 4.0许可下发布,用于商业或生产训练需获取单独的付费许可。




