AutoAEG
收藏资源简介:
该数据集是 AutoAEG(自动音频增强生成)项目迁移数据集的一部分,旨在提供重现当前 SFT-v3、GRPO 和 AEGBench 评估流程所需的最小数据。数据集包含以下三个子集:1) datasets/sft10k_v3/:包含监督微调(SFT-v3)的训练记录及对应音频文件;2) datasets/grpo_annotation/grpo_freesound_train_withrej/:包含 GRPO(Group Relative Policy Optimization)训练所需的注释记录和 2,000 个参考音频文件;3) AEGBench/:包含 AEGBench 评估基准的清单文件及参考音频。数据集排除了模型权重、LoRA/检查点、优化器状态、运行时环境、日志、原始评估输出、Git 捆绑包、凭证以及可选的 SFT 基线源池等无关内容。该数据集主要用于音频生成模型的 SFT、GRPO 训练以及 AEGBench 基准评估。
This dataset is part of the AutoAEG (Automatic Audio Enhancement Generation) project migration dataset, designed to provide the minimal data required to reproduce the current SFT-v3, GRPO, and AEGBench evaluation pipelines. It contains the following three subsets: 1) datasets/sft10k_v3/: includes training records and corresponding audio files for supervised fine-tuning (SFT-v3); 2) datasets/grpo_annotation/grpo_freesound_train_withrej/: includes annotation records and 2,000 reference audio files for GRPO (Group Relative Policy Optimization) training; 3) AEGBench/: includes manifest files and reference audio for the AEGBench evaluation benchmark. The dataset excludes irrelevant content such as model weights, LoRA/checkpoints, optimizer states, runtime environments, logs, raw evaluation outputs, Git bundles, credentials, and optional SFT baseline source pools. It is primarily used for SFT, GRPO training of audio generation models, and AEGBench benchmark evaluation.
AutoAEG migration datasets 数据集概述
数据集简介
- Pretty Name: AutoAEG migration datasets
- 数据集地址: https://huggingface.co/datasets/zihan-audio/AutoAEG
数据集用途
该数据集仓库包含复现 AutoAEG 代码仓库中当前 SFT-v3、GRPO 以及 AEGBench 评估工作流程所需的最小数据。
包含路径
datasets/sft10k_v3/:可直接用于训练的 SFT-v3 记录及音频。datasets/grpo_annotation/grpo_freesound_train_withrej/:GRPO 记录以及所引用的 2,000 个音频文件。AEGBench/:AEGBench 清单及所引用的音频。
有意排除的内容
- 基础模型权重
- LoRA/检查点
- 优化器状态
- 运行时环境
- 日志
- 原始评估输出
- Git bundles
- 凭证
- 可选的 SFT 基线源池
数据清单
完整的数据清单记录于 UPLOAD_MANIFEST.json 中。





