遇见数据集

horrid-qvc/ArabicVoicesPseudo_v4

收藏
Hugging Face2026-03-19 更新2026-03-29 收录
官方服务:

资源简介:

--- dataset_info: features: - name: audio_filepath dtype: string - name: text dtype: string - name: speaker dtype: string - name: duration dtype: float32 - name: session_id dtype: string - name: start dtype: float32 - name: end dtype: float32 - name: word_count dtype: int32 - name: audio dtype: audio: sampling_rate: 16000 - name: gemini_transcript dtype: string splits: - name: train num_bytes: 7182793057 num_examples: 22843 download_size: 7177996028 dataset_size: 7182793057 configs: - config_name: default data_files: - split: train path: data/train-* ---

数据集信息: 特征字段: - 名称:音频文件路径(audio_filepath),数据类型:字符串 - 名称:文本内容(text),数据类型:字符串 - 名称:说话人(speaker),数据类型:字符串 - 名称:时长(duration),数据类型:32位浮点数 - 名称:会话ID(session_id),数据类型:字符串 - 名称:起始时间(start),数据类型:32位浮点数 - 名称:结束时间(end),数据类型:32位浮点数 - 名称:词数(word_count),数据类型:32位整数 - 名称:音频数据(audio),数据类型:采样率16000Hz的音频格式 - 名称:Gemini转录文本(gemini_transcript),数据类型:字符串 数据集划分: - 划分名称:训练集(train),字节大小:7182793057,样本数量:22843 下载大小:7177996028 数据集总大小:7182793057 配置项: - 配置名称:默认配置(default),数据文件: - 数据集划分:训练集,路径:data/train-*

提供机构:
horrid-qvc
二维码
社区交流群
二维码
科研交流群
商业服务