遇见数据集

cantabile-runs

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

该数据集是Cantabile动力学研究工作队列和检查点存储库,包含多种实验配置和训练结果。数据以目录树形式组织:主目录下按歌曲(song)和方法(method)划分,每个方法下的种子(seed)文件夹存放训练过程中生成的检查点文件(.pt)以及任务声明和失败标记。数据集包含三种方法:base(基线,8M步,标准RoboPianist奖励)、vel(动力学感知,8M步,端到端训练)和vel_res(基于vel在5M检查点上的残差训练,3M步,总步数8M)。检查点仅保留5M、6M、7M、8M步的权重文件,格式为PyTorch state_dict,对应3x256 MLP演员网络,obs_dim和action_dim因手臂而异。此外,还包含歌曲列表(songs_pig150.csv)和manifest.csv元数据。该数据集适用于机器人钢琴家任务的动力学感知训练、迁移学习及模型分析。

This dataset is a repository for the Cantabile dynamics research work queue and checkpoints, containing various experimental configurations and training results. The data is organized in a directory tree: the main directory is divided by song and method, with each methods seed folder storing checkpoint files (.pt) generated during training, along with task declarations and failure markers. The dataset includes three methods: base (baseline, 8M steps, standard RoboPianist reward), vel (dynamics-aware, 8M steps, end-to-end training), and vel_res (residual training on vels 5M checkpoint, 3M steps, total 8M steps). Checkpoints only retain weight files at 5M, 6M, 7M, 8M steps, saved as PyTorch state_dict for a 3x256 MLP actor network, with obs_dim and action_dim varying by arm. Additionally, it includes a song list (songs_pig150.csv) and manifest.csv metadata. The dataset is suitable for dynamics-aware training, transfer learning, and model analysis in robotic pianist tasks.

创建时间:
2026-08-31
原始信息汇总

数据集概述:cantabile-runs

该数据集是 Cantabile 动力学研究项目 的工作队列与检查点存储库。其设计核心为目录树即计划——没有独立的计划文件,也没有数据库,所有任务状态均通过文件系统的目录结构和文件标记来管理。

一、工作机制

目录结构定义了任务队列和进度状态,具体规则如下:

  • 目录层级main/<歌曲>/<方法>/
  • 状态表示
    • 目录下存在 .gitkeep 文件 → 任务已排队,尚未认领
    • 目录下存在 CLAIM-<worker> 文件 → 任务已被某工作节点认领(文件修改时间作为心跳信号)
    • 目录下存在 *.pt 文件(5M/6M/7M/8M 检查点) → 训练已完成
    • 目录下存在 FAILED 文件 → 任务崩溃,需要人工介入
  • 认领逻辑:工作节点遍历 main/ 目录,选择没有 CLAIM 文件且没有 .pt 文件的单元,写入认领文件后开始训练,完成后上传检查点并移除认领文件。
  • 超时接管:认领文件超过 60 分钟未被修改,视为任务被放弃,其他节点可接管。

二、方法配置

数据集包含三种训练方法,区别在于奖励设置和训练步数:

方法 奖励配置 训练步数 说明
base v=0, o=0 8M 标准 RoboPianist 奖励,基线模型
vel v=0.2, o=0.5 8M 动力学感知方法,端到端训练
vel_res 基于 vel 的残差 3M vel 的 5M 检查点分支训练,总步数 5M+3M=8M,三种方法成本相同

特殊规则vel_res 只有在 main/<歌曲>/vel/<种子>/05000000.pt 存在时才能被认领,但其文件夹可随时创建。

三、添加新歌曲

创建 main/<歌曲>/<方法>/.gitkeep 文件即可。文件夹名称对应于 songs_pig150.csv 中的 folder 列,该 CSV 文件还记录了每首歌曲被选中(或未选中)所依据的动力学统计数据。

四、检查点详情

  • 保留范围:仅保留训练步数 5M–8M 的检查点。1M–4M 的检查点在训练过程中存在但不上传,因为完整研究跨度的这些数据将占用数十 GB 存储,且无人读取。训练曲线记录在 wandb 中。
  • 保留 5M 的原因:5M 是 vel_res 方法分支训练的起点。
  • 权重格式:PyTorch state_dict,对应一个 3x256 MLP actor 网络,使用 tanh 近似的 GELU 激活函数。
  • 维度记录obs_dimaction_dim 会因不同方法(手臂)而异,具体数值记录在 manifest.csv 文件中。
搜集汇总
数据集介绍
cantabile-runs 数据集图片
构建方式
cantabile-runs数据集是康塔比莱动力学研究的工作队列与检查点存储库,其构建方式独树一帜,以目录树结构作为唯一的规划蓝图,摒弃了传统的计划文件与数据库。具体而言,数据集按主目录下的歌曲与方法层级组织,每个工作单元以子目录形式存在,包含占位符、声明文件或训练产出的检查点。工作进程扫描主目录,认领无声明且无检查点的单元,写入声明文件后执行训练,最终上传检查点并移除声明。对于超过60分钟未更新的声明,系统判定为放弃并允许其他进程接管,以此确保任务调度的鲁棒性与高效性。
特点
数据集的核心特色在于其动态感知的训练策略与经济的存储设计。包含三种方法:基线方法采用标准RoboPianist奖励;速度方法则引入动力学感知奖励(速度权重0.2,方向权重0.5)进行端到端训练;残差方法从速度方法的5M检查点分支,仅额外训练3M步,使总步数均为8M,成本均衡。检查点仅保留5M至8M区间,早期检查点不存储以避免冗余,因训练曲线存于wandb,而完整区间将占用数十GB且无人读取。5M检查点作为分支关键点被特意留存。每首歌曲的元数据(如动力学统计)记录于CSV文件,便于追溯选择依据。
使用方法
使用该数据集主要涉及工作认领与结果整合流程。研究者可依据目录结构查看已有任务的进度,若需新增歌曲,只需创建相应目录并添加占位文件。训练进程通过认领机制获取任务,训练完成后上传检查点至对应目录。对于周期性与残差方法,需确保前置依赖(如速度方法的5M检查点)已存在。最终模型权重为PyTorch状态字典,适用于3x256的MLP演员网络,且输入输出维度因任务而异,记录于manifest.csv文件。该设计支持分布式环境下的多worker协作,同时保证学习曲线的可追溯性与实验的可重复性。
背景与挑战
背景概述
cantabile-runs 数据集源于一项名为 Cantabile 的动力学研究,旨在通过强化学习训练钢琴演奏智能体。该研究由相关领域的研究人员于近期开展,核心问题在于如何使智能体在动态环境中实现精细的运动控制。数据集以工作队列和检查点存储的形式,记录了不同方法(如 base、vel、vel_res)在多个乐曲上的训练过程,并保存了 5M 至 8M 步的模型参数。该数据集的设计体现了对训练流程的深度优化,其独特的文件系统规划方式(以目录树代替传统数据库)为分布式训练提供了轻量级解决方案,对后续大规模强化学习实验的数据管理具有示范意义。
当前挑战
该领域面临的核心挑战在于,钢琴演奏任务要求极高的时序精确性和动态适应性,而传统奖励设计难以捕捉音乐表现力,导致训练效率低下。cantabile-runs 数据集通过引入动力学感知奖励(如速度项和正则项)来缓解此问题,但构建过程中仍遇到多重困难:首先,不同方法(如基于残差的迁移学习)需严格依赖先前检查点,增加了任务调度的复杂性;其次,检查点存储仅保留部分阶段以节约空间,却可能限制后续分析;再者,工作节点的心跳机制需精准处理超时与冲突,确保训练进程的可靠性。
常用场景
经典使用场景
cantabile-runs数据集专为钢琴演奏动力学模拟研究设计,其核心使用场景在于管理并存储大规模强化学习训练过程中产生的模型检查点与工作队列状态。数据集的目录结构本身即构成一种编排计划,通过预设的主目录层级,将不同歌曲、训练方法与随机种子对应的实验单元进行组织化调度。研究者可依据此结构,对RoboPianist环境中多种动力学感知策略(如基础奖励、速度奖励及速度残差分支)的长时程训练轨迹进行断点续训与结果归档,为涌现出稳定而灵巧的虚拟钢琴演奏行为提供了可复现的实验基座。
实际应用
在实际工程与科研应用中,cantabile-runs数据集支撑了虚拟钢琴师在双臂协同演奏中的精细化动力学建模。其存储的检查点能被直接加载至RoboPianist的模拟环境,用于评估习得策略对外部干扰的鲁棒性,或迁移至相近的灵巧操作任务。数据集收录的150余首曲目的动力学统计数据,可为音乐教育软件中的自动伴奏与指法可视化提供先验知识。同时,设计的工作队列模式也可被借鉴至广泛的计算资源调度系统,用于管理大型实验矩阵的异步执行与故障恢复。
衍生相关工作
围绕cantabile-runs中呈现的训练范式,后续工作可沿三条路径衍生:其一,对速度残差分支的结构进行拓展,探索多层残差或课程式微调在更高难度曲目上的效果;其二,将存储的5M至8M步的轨迹数据用于离线强化学习,研究基于曲目动力学统计特征的泛化策略;其三,借鉴其无中央数据库的任务管理模式,构建跨机构协作的大规模科学计算工作流。此类衍生研究将推动数据驱动控制理论在艺术与运动技能领域的交叉融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务