遇见数据集

atec2026-task-e-reproducibility

收藏
Hugging Face2026-07-31 更新2026-08-01 收录
官方服务:

资源简介:

该数据集是ATEC2026线上赛L0「桌面整理 Task E」的复现数据与日志,由Datawhale团队在赛后开源。核心数据是一个经过过滤的100-demo HDF5文件(trajectory_filtered.hdf5),用于训练ACT(Action Chunking with Transformers)模型的最佳方案(seed1)。该HDF5文件按100MiB分片存储(共337个分片,part-0000至part-0336),合并后总大小约为33.7GB(原始未过滤版本约121GB)。此外,数据集还包含调试日志、评估日志以及关键视频归档(logs/task_e_logs_20260520_20260609.tar.zst),用于复盘ACT、XSA-ACT、PCA/GraspGen-style、AnyGrasp/GraspNet、SAM、pi0.5/OpenPI等多种技术路线。该数据集主要用于机器人操作任务中的桌面整理场景,适用于基于模仿学习(如ACT)的模型训练与复现。

This dataset consists of the reproduction data and logs from ATEC2026 online competition L0 Desktop Organization Task E, open-sourced by the Datawhale team after the competition. The core data is a filtered 100-demo HDF5 file (trajectory_filtered.hdf5) for training the best solution (seed1) of the ACT (Action Chunking with Transformers) model. The HDF5 file is stored in 100MiB shards (337 shards, part-0000 to part-0336), with a total size of about 33.7GB after merging (the original unfiltered version is about 121GB). The dataset also includes debug logs, evaluation logs, and a key video archive (logs/task_e_logs_20260520_20260609.tar.zst) for reviewing various technical routes including ACT, XSA-ACT, PCA/GraspGen-style, AnyGrasp/GraspNet, SAM, pi0.5/OpenPI, etc. This dataset is mainly used for desktop organization scenarios in robotic manipulation tasks, suitable for training and reproducing imitation learning models (e.g., ACT).

创建时间:
2026-07-19
原始信息汇总

数据集概述

本数据集是 Datawhale ATEC2026 线上赛 L0「桌面整理 Task E」赛后开源复现所需的大文件存储仓库,主要用于支持 ACT(Action Chunking with Transformers)方案的训练复现与路线复盘。

仓库内容

仓库包含两类核心文件:

文件/目录 说明
data/final_100demos_filtered_split_100m/trajectory_filtered.hdf5.part-0000 ... part-0336 ACT seed1 best 方案训练使用的过滤后 100-demo HDF5 轨迹文件,按 100MiB 分片存储,共 337 个分片。合并后文件名为 trajectory_filtered.hdf5
logs/task_e_logs_20260520_20260609.tar.zst Task E 的调试日志、评估日志和关键视频归档,用于复盘 ACT、XSA-ACT、PCA/GraspGen-style、AnyGrasp/GraspNet、SAM、pi0.5/OpenPI 等多条技术路线。

文件恢复与校验

  • 分片合并命令cat data/final_100demos_filtered_split_100m/trajectory_filtered.hdf5.part-* > trajectory_filtered.hdf5
  • 校验方式:合并后使用 sha256sum trajectory_filtered.hdf5SHA256_FILTERED_ORIGINAL.txt 内容比对;上传分片的 SHA256 校验值存放在 SHA256SUMS_FILTERED_SPLIT.txt

不包含的内容

  • 原始未过滤的 trajectory.hdf5(约 121GB,属于采集/过滤中间产物)
  • 失败实验的 checkpoint
  • OpenPI/pi0.5 训练状态
  • Isaac/系统缓存和临时下载缓存

配套资源

  • 配套代码教程:GitHub 仓库 datawhalechina/every-embodied 中的 ATEC2026 L0 桌面整理 TaskE 目录(https://github.com/datawhalechina/every-embodied/tree/main/15-Challenge%E7%AB%9E%E8%B5%9B/ATEC2026/L0-%E6%A1%8C%E9%9D%A2%E6%95%B4%E7%90%86TaskE)
  • 配套模型权重:Hugging Face 模型仓库 Datawhale/atec2026-task-e-act-seed1-best(https://huggingface.co/Datawhale/atec2026-task-e-act-seed1-best)

元数据

  • 任务类别:robotics(机器人操作)
  • 标签:ATEC2026、Piper、ACT、robot-manipulation
  • 许可证:other(其他)
搜集汇总
数据集介绍
atec2026-task-e-reproducibility 数据集图片
构建方式
该数据集源自Datawhale ATEC2026线上赛L0桌面整理Task E的赛后开源复现项目,聚焦于机器人操作领域中的动作分块变换器(ACT)模型训练数据。构建过程严谨,原始采集的轨迹数据经过精细过滤,筛选出100个高质量演示,并整合为单一HDF5文件。为便于网络传输与存储,该文件按100MiB分片切割,附带SHA256校验和,确保数据完整性与可追溯性。此外,数据集还包含训练日志、评估日志及关键视频归档,全面记录复现过程中的调试与评估细节。
特点
该数据集的核心特点在于其针对性与实用性。过滤后的100个演示数据专为ACT模型训练优化,剔除了冗余或噪声样本,提升了学习效率。分片存储设计兼顾了大文件管理的便捷性与下载灵活性,而详尽的校验信息保障了数据可靠性。配套日志覆盖多种算法路线的探索,如XSA-ACT、GraspGen等,为研究者提供了宝贵的对比参考,极大促进了桌面整理任务的算法复现与创新。
使用方法
使用者通过简单的cat命令合并分片文件,即可恢复完整的trajectory_filtered.hdf5,随后可将其直接用于ACT模型训练。数据仓库提供的GitHub教程与模型权重,简化了从数据到模型的部署流程。日志归档便于复盘不同方法的表现,助力算法调优。该数据集设计兼顾易用性与完整性,是机器人操作领域研究与竞赛复现的理想资源。
背景与挑战
背景概述
该数据集由Datawhale团队于2026年创建,旨在支持ATEC2026线上赛L0「桌面整理Task E」的赛后复现工作。核心研究问题聚焦于机器人操作任务中的动作生成模型,尤其是Action Chunking with Transformers (ACT) 模型的复现与验证。数据集提供了过滤后的100演示轨迹数据(trajectory_filtered.hdf5)以及详细的日志档案,覆盖了ACT、XSA-ACT、PCA/GraspGen-style、AnyGrasp/GraspNet、SAM、pi0.5/OpenPI等多种技术路线的调试与评估记录。作为机器人操作领域的重要开源资源,该数据集促进了复杂桌面整理任务的算法复现与基准比较,对推动具身智能研究具有显著影响力。
当前挑战
该数据集所解决的领域问题包括机器人操作中的动作生成与泛化,其核心挑战在于从有限演示中学习鲁棒策略,并适应桌面整理任务的动态变异性。构建过程中,团队面临了原始数据规模庞大(未过滤HDF5约121GB)与处理效率的矛盾,需通过精细过滤保留关键信息;同时,跨多模型架构(如ACT与pi0.5)的日志整合与关键视频归档增添了数据管理的复杂度。此外,为确保复现性,分片传输与SHA256校验机制需严格设计,并明确排除中间产物以避免误导,这些均对数据集的完整性与可用性提出了高要求。
常用场景
经典使用场景
该数据集作为ATEC2026桌面整理任务(Task E)的复现核心,主要服务于机器人操作学习领域的研究与开发。依托于过滤后的100个演示轨迹HDF5文件,研究者能够基于ACT(Action Chunking with Transformers)等模仿学习算法进行模型训练与评估。其经典使用场景涵盖:从零复现竞赛优胜方案、在固定演示集上比较不同动作分块策略的效能、以及验证数据过滤与增强方法对操作泛化能力的影响。该数据集还配套详尽的日志与视频归档,便于研究者还原实验链条,深入剖析模型在真实桌面整理任务中的行为特性与瓶颈。
衍生相关工作
该数据集衍生了一系列后续经典工作,极具启发价值。基于其过滤后的演示数据,研究者已探索了多种先进方法,包括XSA-ACT(扩展状态空间动作分块)、PCA/GraspGen风格的抓取生成、以及结合AnyGrasp/GraspNet的感知-操作融合管线。此外,数据集中的日志也催生了对大规模预训练模型(如pi0.5/OpenPI)在桌面操作任务上微调的研究,进而推动基于上下文学习的操作策略发展。这些衍生工作不仅丰富了模仿学习与具身智能的方法论,也为机器人操作基准测试的社区共识与标准化贡献了重要参考。
数据集最近研究
最新研究方向
该数据集聚焦于具身智能领域中的机器人操作任务,特别是针对桌面整理场景的复现研究。当前前沿方向围绕端到端模仿学习方法(如ACT)的数据效率与泛化能力展开,通过过滤高价值轨迹、分片存储与日志归档,支撑从数据采集、模型训练到评估验证的全流程复现。研究热点涉及结合视觉-语言-动作模型(如pi0.5/OpenPI)与抓取算法(如AnyGrasp/GraspNet),并探索多模态感知与运动执行的融合。该数据集的意义在于提供可复现的基准,促进社区在复杂操作任务上的算法对比与迭代,加速机器人学习技术的实用化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务