遇见数据集

pilot-corpus-v0.1

收藏
Hugging Face2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

Pilot Corpus v0.1是一个用于机器人学习预训练的、基于指针的微型混合数据集。其核心设计是提供清单(manifests)和代码,而非直接存储媒体文件,每个数据片段都是指向原始数据集的虚拟指针(包含episode、起始时间、结束时间),数据集加载器根据需要动态重构帧,从而避免视频切割、转码或重新分发,确保许可证清洁。数据集包含7个数据分支(tranches),全面覆盖机器人学习关键领域:遥操作(teleop)、UMI、自我中心灵巧操作(egodex)、自我/外部视角野外视频(egowild/exo)、互联网动作视频(internet)以及模拟数据(sim)。它包含所有相关标签类型:视觉(vision)、本体感觉(proprio)、动作(action)、力(force)、姿态(pose)和语言(lang),每个片段都带有领域标签(domain_tags)。数据集清单以Parquet格式存储,每行代表一个虚拟片段,包含clip_id、分支、源仓库、源片段、时间范围、原生帧率、分辨率、各类标签、领域标签、漂移分数、接触事件、仅用于姿态评估标志和数据分割等信息。原生帧率完整保留,从未重采样,这对接触瞬态资格屏蔽调度器至关重要。数据规模方面,清单当前引用总计约306,442个剪辑,总时长约243.3小时。数据集适用于在单个GPU上运行从零开始与预初始化对比的实验,旨在作为一个完全具有代表性但规模较小的试点,为机器人学习的多模态预训练提供多样化数据基础。用户需要自行下载引用的原始数据集(如来自HuggingFace的EgoDex-LeRobot-v3.0、umi_cup_in_the_wild等),并将加载器指向这些本地数据。目前存在已知限制:已下载的AgiBot数据(提供真实的6自由度末端执行器力矩和关节力矩信号)尚未整合;接触伪标签(第二阶段)尚未计算;纯视频分支的数据规模低于原计划目标;以及潜在缓存(第四阶段)未构建。

Pilot Corpus v0.1 is a pointer-based miniature mixed dataset for robot learning pre-training. Its core design philosophy is to provide manifests and code instead of directly storing media files. Each clip is a virtual pointer to the original source dataset (including episode, start time, end time), and the dataset loader dynamically reconstructs frames from the original datasets as needed, avoiding video cutting, transcoding, or redistribution to ensure license cleanliness. The dataset contains 7 tranches, comprehensively covering key areas of robot learning: teleop, UMI, egodex, egowild/exo, internet, and sim. It includes all relevant label types: vision, proprio, action, force, pose, and lang, with each clip tagged with domain tags. The manifests are stored in Parquet format, each row representing a virtual clip with information such as clip_id, tranche, source repository, source clip, time range, native frame rate, resolution, various labels, domain tags, drift score, contact events, pose-only evaluation flag, and data split. The native frame rate is fully preserved without resampling, which is crucial for contact transient eligibility masking schedulers. In terms of scale, the manifests currently reference approximately 306,442 clips in total, with a total duration of about 243.3 hours. The dataset is suitable for experiments run on a single GPU, comparing from-scratch and pre-initialized approaches, aiming to serve as a fully representative but small-scale pilot for multimodal pre-training in robot learning. Users need to download the referenced original datasets (e.g., EgoDex-LeRobot-v3.0, umi_cup_in_the_wild from HuggingFace) and point the loader to these local data. There are known limitations: downloaded AgiBot data (providing real 6-DOF end-effector torque and joint torque signals) is not yet integrated; contact pseudo-labels (phase 2) are not computed; the scale of pure-video tranches is below the original target; and potential caching (phase 4) is not built.

创建时间:
2026-07-03
原始信息汇总

数据集概述:Pilot Corpus v0.1

项目定位:一个冻结的、基于指针的机器人学习预训练混合数据集的微型版本,专为单GPU上的 scratch-vs-init 实验设计。

核心特性

  • 虚拟剪辑:数据集不包含任何视频媒体,仅提供清单文件和代码。每个“剪辑”是一个指向源数据集中 (episode, t_start, t_end) 的虚拟指针。用户需自行下载底层数据集,加载器按需从原始数据中重建帧。
  • 数据构成:共包含7个数据块(tranches),涵盖遥操作、UMI、自我中心灵巧操作、自我/外部野生视频、互联网动作视频和仿真环境。
  • 标签类型:覆盖所有标注类型:视觉(vision)、本体感知(proprioception)、动作(action)、力(force)、姿态(pose)、语言(lang)。
  • 领域标签:每个数据块均包含领域标签(domain_tags)。

数据规模(当前清单引用)

数据块 来源(Hugging Face 仓库) 剪辑数 / 小时数 标签类型
egodex griffinlabs/EgoDex-LeRobot-v3.0 15,739 / 12.8小时 vision, pose, lang
umi lerobot/umi_cup_in_the_wild 45,479 / 37.8小时 vision, proprio, action
teleop lerobot/aloha_mobile_cabinet 1,615 / 1.4小时 vision, proprio, action, force
exo hyf015/EgoExoLearn 38,310 / 31.9小时 vision
egowild a1raman/epic_kitchens_100 9,247 / 7.7小时 vision
internet morpheushoc/something-something-v2 179,184 / 138.8小时 vision, lang
sim physical-intelligence/libero 16,868 / 13.9小时 vision, proprio, action, lang

数据结构与文件布局

  • src/corpus/:包含模式定义、清单I/O、加载器(v2.x/v3.0/image-parquet适配器)、配额采样器和清单构建器。
  • manifests/:包含每个数据块及合并后的 Parquet 清单文件(单一真实数据源),以及 exo_crossview_index.csvinternet_template_index.csv
  • probes/:包含冻结的评估集(周期级分割)和 FROZEN_HASHES.txt
  • configs/quota.yaml:定义每个批次的数据块混合比例(实验起点)。
  • tests/:包含模式往返测试、v3.0 解码测试、构建测试、仿真/互联网测试。
  • scripts/:包含统计生成脚本、冻结探针脚本和阶段0验证脚本。
  • STATS.md:生成的单页数据总结。

清单模式:每行代表一个虚拟剪辑,包含以下字段:clip_id, tranche, source_repo, source_episode, t_start, t_end, native_fps, resolution, lbl_{vision,proprio,action,force,pose,lang}, domain_tags, drift_score, contact_events, pose_eval_only, splitnative_fps 保持原始帧率不变,是掩码调度器判断接触瞬态资格的依据。

已知限制(v0.1版本)

  • AgiBot数据暂未纳入清单raw/teleop/AgiBotWorld-Beta(72GB,带真实6自由度扳手)和 raw/sim/AgiBotDigitalWorld(20.7GB,带关节力矩)已下载但尚未完成 LeRobot 转换和清单重建。当前清单中的 teleop 数据块仅包含 ALOHA 数据,接触丰富类数据块和接触事件目标尚未满足。
  • 接触伪标签(阶段2):尚未计算,因此 probe_contact 为空。
  • 视频数据块小时数不足:纯视频数据块的小时数比计划目标低约10倍,这是故意设计的完全代表性小型试点,而非全规模混合。
  • 潜在缓存(阶段4):需要GPU且未在此构建。

使用方式: bash uv sync uv run python -m corpus.build_manifest --all # (re)build manifests from raw/ uv run python scripts/gen_stats.py # STATS.md uv run python scripts/freeze_probes.py # probe sets + hashes uv run pytest -q # full suite

python from corpus.manifest import read_manifest from corpus.loader import ClipDataset ds = ClipDataset(read_manifest("manifests/corpus.parquet"), raw_root="raw") sample = ds[0] # ClipSample(frames (T,H,W,3) uint8, native_fps, labels, ...)

搜集汇总
数据集介绍
pilot-corpus-v0.1 数据集图片
构建方式
Pilot Corpus v0.1 是一个基于指针的轻量级机器人学习预训练数据集的缩影。其构建方式独具匠心,通过将每个剪辑片段定义为指向原始数据集中的虚拟指针(episode, t_start, t_end),而非直接复制或转码视频媒体,从而避免了数据冗余。该数据集的核心是 manifests/*.parquet 文件,作为唯一真实数据源,加载器可据此按需从原始数据集中重构帧数据。整个数据集涵盖七个子集,包括遥操作、UMI、自我中心灵巧操作、自我/外部视角野外视频、互联网动作视频及仿真数据。用户需自行下载底层原始数据集,并配置加载器指向相应路径,即可使用该语料库。
特点
该数据集的特点在于其高度的标签完整性与领域多样性。每个剪辑行包含clip_id、tranche、source_repo、source_episode等字段,并涵盖了视觉、本体感觉、动作、力、姿态和语言等所有标注类型,以及多样的领域标签。数据集的帧率(native_fps)保持原始状态,从未重采样,为掩码调度器处理接触瞬态事件提供了精确的时间轴依据。此外,该数据集通过冻结的评估集(probes)和哈希值确保实验的可重复性,并采用配额抽样器实现批次级别的子集混合,为单GPU上的从头训练与预训练对比实验提供了理想的基准平台。
使用方法
使用Pilot Corpus v0.1数据集需遵循特定流程。首先,通过命令行执行 `uv sync` 同步依赖,再运行 `python -m corpus.build_manifest --all` 从原始数据重建清单文件,随后使用 `scripts/gen_stats.py` 生成统计信息,并利用 `scripts/freeze_probes.py` 固化评估集。在代码层面,用户可通过导入 `corpus.manifest` 和 `corpus.loader` 模块,调用 `read_manifest` 函数读取清单文件,并实例化 `ClipDataset` 加载器,设置原始数据根目录 `raw_root`,即可按索引获取包含帧序列、原生帧率及标签信息的 `ClipSample` 对象,实现数据的高效访问与迭代。
背景与挑战
背景概述
Pilot Corpus v0.1 数据集创建于机器人学习领域对多模态、多源数据融合需求日益增长的背景下,由多家研究机构联合构建,旨在为预训练混合数据提供一种轻量级、可复现的基准。该数据集通过指针式设计,整合了遥操作、灵巧操作、自我中心及外部视角视频、互联网动作视频及仿真数据等7个数据切片,覆盖视觉、本体感知、动作、力、位姿及语言等多种标注类型。其核心研究问题在于如何在不重新编码原始视频的前提下,高效构建一个具有代表性的小型混合体,以支持单GPU上的从头训练与迁移学习对比实验。该数据集对机器人学习预训练策略评估、多源数据统一表征及可复现性研究具有重要影响,为后续大规模数据混合提供了标准化工具与参考框架。
当前挑战
该数据集所解决的领域挑战在于机器人学习预训练中数据异构性与规模扩展的矛盾:不同来源的数据在帧率、标注类型、许可协议及存储格式上差异显著,且多数高质量数据禁止重新分发,亟需一种不依赖视频转码的轻量级索引方案。构建过程中面临的具体挑战包括:1)需从7个独立数据源中抽取兼容子集,保持原始帧率不变以避免运动伪影;2)处理许可限制,仅分发元数据而非媒体文件,用户需自行下载原始数据集;3)确保各切片在标注类型和领域标签上的代表性,同时控制总体量以适应单GPU实验;4)将部分已获取但尚未转换的数据(如AgiBot)暂存于原始目录,等待后续格式转换与清单重构。这些挑战共同决定了该数据集作为先锋版本(v0.1)的规模与功能边界。
常用场景
经典使用场景
Pilot Corpus v0.1作为一个基于指针的机器人学习预训练混合物微型数据集,其经典使用场景在于为单GPU环境下的scratch-vs-init实验提供高效的训练框架。该数据集巧妙整合了遥操作、UMI、第一人称灵巧操作、第一人称/第三人称野外视频、互联网动作视频以及模拟环境等七种不同来源的数据,覆盖了视觉、本体感知、动作、力、姿态和语言等全面的标签类型。研究者可利用该数据集在资源受限的条件下,系统比较从零开始训练与基于预训练初始化训练的模型性能差异,从而探索迁移学习和初始化策略在机器人学习中的有效性。其独特的clip指针设计避免了视频数据的重复存储,使得在保持数据多样性的同时大幅降低了存储开销,为快速迭代实验提供了理想的数据基础。
衍生相关工作
Pilot Corpus v0.1的发布催生了多个重要的研究方向。其指针式数据管理思想启发了后续的轻量级数据集构建工具,使得研究者能够在不复制原始媒体文件的情况下,灵活组合多个大型机器人数据集。数据集内建的probe冻结评估集为机器人学习领域的标准化评测树立了新范式,推动了多个对比实验基准的建立。基于该数据集的混合采样策略,学术界涌现出一系列关于数据组成对机器人预训练泛化性能影响的研究工作,探索了不同数据源的最佳配比方案。此外,该数据集对接触事件伪标签(Phase 2)的设计预期,为灵巧操作中接触力分析与模型学习方法的结合开辟了新的研究路径,促进了物理交互感知在机器人学习中的深度融合。
数据集最近研究
最新研究方向
Pilot Corpus v0.1作为机器人学习领域一个极具前瞻性的轻量化预训练混合数据集,其最新研究聚焦于通过指针式虚拟裁剪策略构建多模态、多来源的微型训练混合物,以在单GPU上高效执行scratch-vs-init实验。该数据集巧妙融合了遥操作、灵巧操作、第一/第三人称野外视频、互联网动作视频及模拟仿真等7种数据切片,覆盖视觉、本体感知、动作、力觉、位姿及语言全标签体系,尤其注重力觉与接触瞬态信息的保真度。当前研究前沿正围绕其提供的漂移分数与接触事件标签,探索接触动力学伪标签生成及大规模潜表征缓存技术,旨在为机器人策略的零样本泛化与少样本适应能力提供数据支撑。数据集对Agibot World等真实力觉数据的整合,以及对EgoDex、EPIC-KITCHENS等多样化来源的兼容,标志着机器人学习预训练正从同质化向跨域异构数据融合的关键转型,对推动具身智能体在复杂非结构化环境中的鲁棒操作具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务