遇见数据集

ctaguchi/ikema_youtube_asr_full_with_long

收藏
Hugging Face2026-03-27 更新2026-03-29 收录
官方服务:

资源简介:

--- dataset_info: features: - name: audio dtype: audio: sampling_rate: 16000 - name: transcription dtype: string - name: romaji dtype: string - name: phoneme dtype: string - name: start dtype: int64 - name: end dtype: int64 - name: title dtype: string - name: recording_id dtype: string - name: url dtype: string splits: - name: train num_bytes: 1867735804.015 num_examples: 9005 - name: dev num_bytes: 396260497.986 num_examples: 1554 - name: test num_bytes: 360261296.668 num_examples: 1532 - name: longtrain num_bytes: 2142749559.929 num_examples: 3389 - name: longdev num_bytes: 488404304.0 num_examples: 387 - name: longtest num_bytes: 477371843.0 num_examples: 358 download_size: 6107559856 dataset_size: 5732783305.598 configs: - config_name: default data_files: - split: train path: data/train-* - split: dev path: data/dev-* - split: test path: data/test-* - split: longtrain path: data/longtrain-* - split: longdev path: data/longdev-* - split: longtest path: data/longtest-* ---

数据集信息: 特征: - 字段名: audio 数据类型: 音频(Audio),采样率为16000 Hz - 字段名: transcription 数据类型: 字符串 - 字段名: romaji 数据类型: 字符串 - 字段名: phoneme 数据类型: 字符串 - 字段名: start 数据类型: 64位整数 - 字段名: end 数据类型: 64位整数 - 字段名: title 数据类型: 字符串 - 字段名: recording_id 数据类型: 字符串 - 字段名: url 数据类型: 字符串 划分集: - 划分集名称: train(训练集) 字节数: 1867735804.015 样本数: 9005 - 划分集名称: dev(验证集) 字节数: 396260497.986 样本数: 1554 - 划分集名称: test(测试集) 字节数: 360261296.668 样本数: 1532 - 划分集名称: longtrain(长训练集) 字节数: 2142749559.929 样本数: 3389 - 划分集名称: longdev(长验证集) 字节数: 488404304.0 样本数: 387 - 划分集名称: longtest(长测试集) 字节数: 477371843.0 样本数: 358 下载总大小: 6107559856 数据集总大小: 5732783305.598 配置项: - 配置名称: default(默认配置) 数据文件: - 划分集: train(训练集) 路径: data/train-* - 划分集: dev(验证集) 路径: data/dev-* - 划分集: test(测试集) 路径: data/test-* - 划分集: longtrain(长训练集) 路径: data/longtrain-* - 划分集: longdev(长验证集) 路径: data/longdev-* - 划分集: longtest(长测试集) 路径: data/longtest-*

提供机构:
ctaguchi
二维码
社区交流群
二维码
科研交流群
商业服务