cantabile-runs
收藏资源简介:
该数据集是Cantabile动力学研究工作队列和检查点存储库,包含多种实验配置和训练结果。数据以目录树形式组织:主目录下按歌曲(song)和方法(method)划分,每个方法下的种子(seed)文件夹存放训练过程中生成的检查点文件(.pt)以及任务声明和失败标记。数据集包含三种方法:base(基线,8M步,标准RoboPianist奖励)、vel(动力学感知,8M步,端到端训练)和vel_res(基于vel在5M检查点上的残差训练,3M步,总步数8M)。检查点仅保留5M、6M、7M、8M步的权重文件,格式为PyTorch state_dict,对应3x256 MLP演员网络,obs_dim和action_dim因手臂而异。此外,还包含歌曲列表(songs_pig150.csv)和manifest.csv元数据。该数据集适用于机器人钢琴家任务的动力学感知训练、迁移学习及模型分析。
This dataset is a repository for the Cantabile dynamics research work queue and checkpoints, containing various experimental configurations and training results. The data is organized in a directory tree: the main directory is divided by song and method, with each methods seed folder storing checkpoint files (.pt) generated during training, along with task declarations and failure markers. The dataset includes three methods: base (baseline, 8M steps, standard RoboPianist reward), vel (dynamics-aware, 8M steps, end-to-end training), and vel_res (residual training on vels 5M checkpoint, 3M steps, total 8M steps). Checkpoints only retain weight files at 5M, 6M, 7M, 8M steps, saved as PyTorch state_dict for a 3x256 MLP actor network, with obs_dim and action_dim varying by arm. Additionally, it includes a song list (songs_pig150.csv) and manifest.csv metadata. The dataset is suitable for dynamics-aware training, transfer learning, and model analysis in robotic pianist tasks.
数据集概述:cantabile-runs
该数据集是 Cantabile 动力学研究项目 的工作队列与检查点存储库。其设计核心为目录树即计划——没有独立的计划文件,也没有数据库,所有任务状态均通过文件系统的目录结构和文件标记来管理。
一、工作机制
目录结构定义了任务队列和进度状态,具体规则如下:
- 目录层级:
main/<歌曲>/<方法>/ - 状态表示:
- 目录下存在
.gitkeep文件 → 任务已排队,尚未认领 - 目录下存在
CLAIM-<worker>文件 → 任务已被某工作节点认领(文件修改时间作为心跳信号) - 目录下存在
*.pt文件(5M/6M/7M/8M 检查点) → 训练已完成 - 目录下存在
FAILED文件 → 任务崩溃,需要人工介入
- 目录下存在
- 认领逻辑:工作节点遍历
main/目录,选择没有CLAIM文件且没有.pt文件的单元,写入认领文件后开始训练,完成后上传检查点并移除认领文件。 - 超时接管:认领文件超过 60 分钟未被修改,视为任务被放弃,其他节点可接管。
二、方法配置
数据集包含三种训练方法,区别在于奖励设置和训练步数:
| 方法 | 奖励配置 | 训练步数 | 说明 |
|---|---|---|---|
base |
v=0, o=0 | 8M | 标准 RoboPianist 奖励,基线模型 |
vel |
v=0.2, o=0.5 | 8M | 动力学感知方法,端到端训练 |
vel_res |
基于 vel 的残差 |
3M | 从 vel 的 5M 检查点分支训练,总步数 5M+3M=8M,三种方法成本相同 |
特殊规则:vel_res 只有在 main/<歌曲>/vel/<种子>/05000000.pt 存在时才能被认领,但其文件夹可随时创建。
三、添加新歌曲
创建 main/<歌曲>/<方法>/.gitkeep 文件即可。文件夹名称对应于 songs_pig150.csv 中的 folder 列,该 CSV 文件还记录了每首歌曲被选中(或未选中)所依据的动力学统计数据。
四、检查点详情
- 保留范围:仅保留训练步数 5M–8M 的检查点。1M–4M 的检查点在训练过程中存在但不上传,因为完整研究跨度的这些数据将占用数十 GB 存储,且无人读取。训练曲线记录在 wandb 中。
- 保留 5M 的原因:5M 是
vel_res方法分支训练的起点。 - 权重格式:PyTorch
state_dict,对应一个 3x256 MLP actor 网络,使用 tanh 近似的 GELU 激活函数。 - 维度记录:
obs_dim和action_dim会因不同方法(手臂)而异,具体数值记录在manifest.csv文件中。





