Marek324/speech-music-classification
收藏资源简介:
--- pretty_name: Speech / Music classification license: unknown language: en tags: - audio - parquet configs: - config_name: full data_files: - split: train path: full/train/**/*.parquet - split: validation path: full/validation/**/*.parquet - split: test path: full/test/**/*.parquet - config_name: mid data_files: - split: train path: mid/train/**/*.parquet - split: validation path: mid/validation/**/*.parquet - split: test path: mid/test/**/*.parquet - config_name: mini data_files: - split: train path: mini/train/**/*.parquet - split: validation path: mini/validation/**/*.parquet - split: test path: mini/test/**/*.parquet --- ## Structure After `uv run python build.py {mini|mid|full}` for each tier (same `--out-dir` staging parent): ```text <staging>/ full/ # or mid/, mini/ train/ speech/ part_*.parquet music/ inactive/ validation/ speech/ ... test/ ... ``` Parquet columns: `audio` (HF Audio struct), `sampling_rate`, `class`, `subclass`, `source`, `row_idx`, `labels` (list of `{label, start, end}` in ms). ## Upload From the **staging parent** (folder that contains `mini/`, `mid/`, `full/`): ```bash hf upload-large-folder --repo-type dataset YOUR_ORG/YOUR_REPO . ``` ## Load ```python from datasets import load_dataset ds = load_dataset("YOUR_ORG/YOUR_REPO", "full", split="train") # Rows include columns from parquet; decode WAV from bytes if needed. ``` Adjust `YOUR_ORG/YOUR_REPO` and verify YAML against current [Hub dataset data files](https://huggingface.co/docs/hub/datasets-data-files-configuration) if `load_dataset` errors.
pretty_name: 语音/音乐分类(Speech / Music Classification) license: 未知 language: 英语 tags: - 音频(audio) - Parquet(parquet) configs: - config_name: 完整集(full) data_files: - split: 训练集(train) path: full/train/**/*.parquet - split: 验证集(validation) path: full/validation/**/*.parquet - split: 测试集(test) path: full/test/**/*.parquet - config_name: 中等集(mid) data_files: - split: 训练集(train) path: mid/train/**/*.parquet - split: 验证集(validation) path: mid/validation/**/*.parquet - split: 测试集(test) path: mid/test/**/*.parquet - config_name: 小型集(mini) data_files: - split: 训练集(train) path: mini/train/**/*.parquet - split: 验证集(validation) path: mini/validation/**/*.parquet - split: 测试集(test) path: mini/test/**/*.parquet ## 目录结构 针对每个数据集层级(需使用相同的`--out-dir`参数指定暂存父目录)执行`uv run python build.py {mini|mid|full}`命令后,将生成如下目录结构: text <staging>/ full/ # 或 mid/, mini/ train/ speech/ part_*.parquet music/ inactive/ validation/ speech/ ... test/ ... Parquet文件的列字段包括:`audio`(HF Audio 结构体(HF Audio struct))、`sampling_rate`(采样率)、`class`(类别)、`subclass`(子类别)、`source`(数据源)、`row_idx`(行索引)、`labels`(由`{label, start, end}`组成的列表,单位为毫秒)。 ## 上传方式 在包含`mini/`、`mid/`、`full/`的暂存父目录下执行如下命令: bash hf upload-large-folder --repo-type dataset YOUR_ORG/YOUR_REPO . ## 加载示例 python from datasets import load_dataset ds = load_dataset("YOUR_ORG/YOUR_REPO", "full", split="train") # 数据行包含Parquet文件的全部列字段;若需从字节数据中解码WAV音频,请按需自行处理。 若`load_dataset`函数调用报错,请调整`YOUR_ORG/YOUR_REPO`参数,并根据当前[Hub数据集数据文件配置文档](https://huggingface.co/docs/hub/datasets-data-files-configuration)验证YAML配置文件。



