transcribed_description_samples_dialect_22
收藏资源简介:
该数据集是一个小型的音频数据集,包含30个训练样本,总大小约25MB。每个样本包括以下字段:音频文件(audio)、音频时长(duration)、语言(language)、转录文本(transcript_text)、描述(flamingo_next_description)、方言(dialect)以及用例(use_case)。数据集可用于语音识别、多语言语音处理、方言识别或语音内容分析等任务。
This dataset is a small audio dataset containing 30 training samples with a total size of approximately 25MB. Each sample includes the following fields: audio file (audio), audio duration (duration), language (language), transcript text (transcript_text), description (flamingo_next_description), dialect (dialect), and use case (use_case). The dataset can be used for tasks such as speech recognition, multilingual speech processing, dialect identification, or speech content analysis.
数据集概述
基本信息
- 数据集名称:
nadsoft/transcribed_description_samples_dialect_22 - 托管平台: Hugging Face
- 数据集规模: 训练集包含30个样本,总大小约26.49 MB(下载大小约24.99 MB)
数据特征
该数据集的每条样本包含以下7个字段:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
audio |
audio | 音频数据 |
duration |
float64 | 音频时长(秒) |
language |
string | 语言标识 |
transcript_text |
string | 转录文本内容 |
flamingo_next_description |
string | 基于Flamingo模型生成的下一阶段描述文本 |
dialect |
string | 方言类别 |
use_case |
string | 使用场景/用途 |
数据划分
- 训练集(train): 共30个样本
- 数据文件存放于
data/train-*.parquet路径下
数据用途
该数据集的核心用途推测为方言语音的转录与描述任务,每条数据包含原始音频、人工/自动转录文本,以及基于特定模型(Flamingo)生成的描述信息,可用于方言语音识别、语音转录描述生成或多模态语音-文本建模相关方向的研究与训练。




