遇见数据集

manhpv26/khmer-yt-voice-dataset

收藏
Hugging Face2026-04-19 更新2026-04-26 收录
官方服务:

资源简介:

--- language: - km license: cc-by-sa-4.0 task_categories: - automatic-speech-recognition - audio-classification size_categories: - 100K<n<1M --- # Khmer YouTube Voice Dataset Full audio + diarization metadata from Khmer YouTube videos. | Stat | Value | |------|-------| | Videos | 3,945 | | Total turns | 16,021 | | Total duration | 1033.4 hours | | Format | WAV (original sample rate) | ## Structure ``` data/ shard_0000.tar.gz shard_0001.tar.gz ... manifest.jsonl ``` Mỗi shard chứa ~20 videos, mỗi video gồm: ``` video_id/ full.wav # audio nguyên gốc metadata.json # video info + turns (speaker, start, end, transcript) ``` ## manifest.jsonl | Field | Description | |-------|-------------| | `video_id` | YouTube video ID | | `shard` | Shard chứa video | | `duration_sec` | Thời lượng video (seconds) | | `num_turns` | Số turns (speaker segments) | | `title` | Video title | | `channel` | YouTube channel | | `source_url` | YouTube URL |

--- 数据集属性: - 语言:高棉语(km) - 授权协议:CC BY-SA 4.0 - 任务类别:自动语音识别、音频分类 - 数据规模:100,000 < 样本量 < 1,000,000 --- # 高棉语YouTube语音数据集 本数据集包含源自高棉语YouTube视频的完整音频与说话人分割(diarization)元数据。 | 统计指标 | 数值 | |----------|------| | 视频总数 | 3,945个 | | 总说话人轮次 | 16,021个 | | 总音频时长 | 1033.4小时 | | 音频格式 | WAV(保留原始采样率) | ## 数据集结构 data/ shard_0000.tar.gz shard_0001.tar.gz ... manifest.jsonl 每个数据分片(shard)约包含20个视频,单个视频的目录结构如下: video_id/ full.wav # 原始完整音频文件 metadata.json # 视频信息与轮次元数据(含说话人信息、片段起始时间、结束时间、转录文本) ## 清单文件manifest.jsonl | 字段名 | 说明 | |-------|------| | `video_id` | YouTube视频ID | | `shard` | 存储该视频的数据分片(shard) | | `duration_sec` | 视频时长(单位:秒) | | `num_turns` | 总说话人轮次数 | | `title` | 视频标题 | | `channel` | 所属YouTube频道 | | `source_url` | YouTube源链接 |

提供机构:
manhpv26
二维码
社区交流群
二维码
科研交流群
商业服务