telegram-audiobook-chizzled
收藏资源简介:
该数据集包含从通信平台频道中提取的音频片段及其元数据。每个样本包括一段16kHz采样率的音频,以及对应的频道名称、频道ID、消息ID、来源URL、原始文件名、原始文件哈希、音频片段哈希、片段键、片段索引、音频时长、片段在原始音频中的起始和结束时间、VAD处理产生的间隔JSON、VAD阈值、VAD合并间隔、是否为剪切片段标志以及状态信息。数据集共包含46个训练样本,总大小约51.6MB。该数据集可用于语音活动检测、音频分割、说话人识别、语音识别等任务,尤其适用于需要细粒度音频元数据的研究场景。
This dataset contains audio clips extracted from communication platform channels along with their metadata. Each sample includes a 16kHz audio clip, along with channel name, channel ID, message ID, source URL, original filename, original file hash, audio clip hash, clip key, clip index, audio duration, start and end times of the clip in the original audio, VAD interval JSON, VAD threshold, VAD merge interval, is_cut flag, and status information. The dataset contains 46 training samples with a total size of approximately 51.6MB. It can be used for tasks such as voice activity detection, audio segmentation, speaker recognition, and speech recognition, particularly suitable for research scenarios requiring fine-grained audio metadata.
数据集概述:telegram-audiobook-chizzled
基本信息
- 数据集名称:telegram-audiobook-chizzled
- 来源平台:Hugging Face
- 访问地址:https://huggingface.co/datasets/Reza2kn/telegram-audiobook-chizzled
数据规模
- 数据分割:仅包含训练集(train)
- 样本数量:46
- 数据大小:约51.6 MB(下载大小51,644,135字节)
- 格式:默认配置(default)
数据内容与结构
该数据集包含音频及其元数据,每条样本包含以下字段:
| 字段名称 | 数据类型 | 说明 |
|---|---|---|
audio |
音频(采样率16kHz,未解码) | 主要音频数据 |
channel |
字符串 | 频道名称 |
channel_id |
整数(int64) | 频道标识号 |
message_id |
整数(int64) | 消息标识号 |
source_url |
字符串 | 来源链接 |
source_filename |
字符串 | 原始文件名 |
source_sha256 |
字符串 | 来源文件哈希值 |
clip_sha256 |
字符串 | 音频片段哈希值 |
clip_key |
字符串 | 片段唯一键 |
clip_index |
整数(int32) | 片段索引 |
duration_sec |
浮点数(float32) | 音频时长(秒) |
wall_start_sec |
浮点数(float32) | 片段起始时间 |
wall_end_sec |
浮点数(float32) | 片段结束时间 |
intervals_json |
字符串 | 间隔数据(JSON格式) |
vad_threshold |
浮点数(float32) | 语音活动检测阈值 |
vad_merge_gap_sec |
浮点数(float32) | VAD合并间隔(秒) |
chizzled |
布尔值 | 是否经过切分处理 |
status |
字符串 | 处理状态 |
数据集特点
- 来源:Telegram频道上的有声书内容,每个文件源自不同的Telegram频道,通过URL与哈希值保存可追溯溯源
- 处理方式:数据经过语音活动检测(VAD)和切分处理(chizzled),并提供了相关的处理参数(阈值、间隔等)
- 用途:适用于语音识别、音频切分、有声书处理等NLP或语音相关的机器学习任务
数据划分
- 仅有一个训练分割(train),无验证集或测试集
- 全部内容已打包为Hugging Face数据集格式,可通过
data/train-*文件加载使用




