golfoscar/povel-hearheart-dataset
收藏资源简介:
--- license: other task_categories: - text-to-speech - audio-classification language: - ko tags: - asmr - korean - tts - voice-clone - speech size_categories: - 1K<n<10K --- # Povel Hearheart Dataset 한국어 성인 ASMR 음성 데이터셋. Hearheart.com에서 수집한 1,142개 오디오 파일을 처리하여 5,238개 세그먼트로 분할. ## Dataset Structure ``` raw/hearheart/audio/ # 원본 1,142개 WAV 파일 (4.8GB, 29.3시간) processed/hearheart/ ├── vocals/ # Demucs 보컬 분리 결과 (4.8GB) ├── segments/segments/ # VAD 세그먼트 5,238개 WAV (3.5GB) ├── segments/segment_index.json # 세그먼트 인덱스 ├── encoded.jsonl # 코덱 인코딩 결과 4,744개 (79MB) ├── filtered.jsonl # 필터링 결과 └── demucs_results.json # Demucs 처리 메타데이터 ``` ## Processing Pipeline ``` 원본 오디오 → Demucs (음원 분리) → VAD (음성 구간 감지) → Whisper (전사) → 품질 필터링 → 코덱 인코딩 ``` 1. **Demucs**: 배경 음악/노이즈에서 보컬 분리 2. **VAD (Voice Activity Detection)**: 음성 구간 자동 감지 및 세그먼트 분할 3. **Whisper**: 한국어 전사 (STT) 4. **Quality Filtering**: 품질 기준 미달 세그먼트 제거 5. **Codec Encoding**: Qwen3-TTS 12Hz 16-channel RVQ 코덱으로 인코딩 ## Audio Specifications - Sample Rate: 24kHz - Channels: Mono - Bit Depth: 16-bit PCM - Format: WAV ## Use Cases - **Voice Clone Reference**: TTS 모델의 voice clone 레퍼런스 오디오로 사용 - **TTS Fine-tuning**: 음성 합성 모델 학습 데이터 - **Audio Classification**: ASMR 음성 분류 연구 ## Related Project - GitHub: [povel-project](https://github.com/Hyeonseop-Shin/povel-project) ## Citation 이 데이터셋은 연구 목적으로 수집되었습니다.
许可证: 其他 任务类别: - 文本转语音 - 音频分类 语言: - 韩语 标签: - ASMR(自发性知觉经络反应,Autonomous Sensory Meridian Response) - 韩语 - TTS(文本转语音,Text-to-Speech) - 语音克隆(Voice Clone) - 语音 规模类别: - 1K<n<10K --- # Povel Hearheart 数据集 本数据集为韩语成人ASMR(自发性知觉经络反应,Autonomous Sensory Meridian Response)语音数据集。共收集自Hearheart.com的1142条原始音频文件,经处理后分割为5238个语音片段。 ## 数据集结构 raw/hearheart/audio/ # 原始1,142条WAV格式音频文件(总大小4.8GB,总时长29.3小时) processed/hearheart/ ├── vocals/ # Demucs 人声分离结果(总大小4.8GB) ├── segments/segments/ # 基于语音活动检测(VAD, Voice Activity Detection)的5238个语音片段WAV文件(总大小3.5GB) ├── segments/segment_index.json # 语音片段索引文件 ├── encoded.jsonl # 编解码器编码结果文件,共4744条(总大小79MB) ├── filtered.jsonl # 质量过滤结果文件 └── demucs_results.json # Demucs处理元数据文件 ## 处理流程 原始音频 → Demucs(音源分离)→ 语音活动检测(VAD, Voice Activity Detection) → Whisper(语音转录)→ 质量过滤 → 编解码器编码 1. **Demucs**: 从背景音乐与背景噪声中分离人声轨道 2. **语音活动检测(VAD, Voice Activity Detection)**: 自动检测语音活动区间并将音频分割为独立片段 3. **Whisper**: 完成韩语语音转录(STT,语音转文字,Speech-to-Text) 4. **质量过滤**: 移除未达预设质量标准的语音片段 5. **编解码器编码**: 使用Qwen3-TTS 12Hz 16通道RVQ编解码器对音频进行编码 ## 音频规格 - 采样率: 24kHz - 声道数: 单声道 - 位深度: 16位PCM - 格式: WAV ## 应用场景 - **语音克隆参考**: 可作为TTS(文本转语音,Text-to-Speech)模型的语音克隆参考音频 - **TTS微调**: 用于语音合成模型的微调训练数据集 - **音频分类**: 可用于ASMR语音分类相关研究 ## 相关项目 - GitHub仓库: [povel-project](https://github.com/Hyeonseop-Shin/povel-project) ## 引用说明 本数据集仅用于学术研究目的收集。



