transcribed_description_samples
收藏资源简介:
该数据集是一个小型多模态音频数据集,包含30个训练样本。每个样本包括音频文件(audio)、音频时长(duration,float64)、语言标签(language,string)、人工转录文本(transcript_text,string)以及由Flamingo模型生成的描述文本(flamingo_next_description,string)。数据集适用于语音识别、音频描述生成或多语言语音处理等任务的研究与评估。
This dataset is a small multimodal audio dataset containing 30 training samples. Each sample includes an audio file (audio), audio duration (duration, float64), language label (language, string), manually transcribed text (transcript_text, string), and a description text generated by the Flamingo model (flamingo_next_description, string). The dataset is suitable for research and evaluation of tasks such as speech recognition, audio description generation, or multilingual speech processing.
数据集概述:transcribed_description_samples
基本信息
- 数据集名称:transcribed_description_samples
- 来源平台:Hugging Face
- 数据集地址:https://huggingface.co/datasets/nadsoft/transcribed_description_samples
数据规模
- 总样本数:30 条(仅包含训练集)
- 数据集总大小:约 26.49 MB(26,488,727 字节)
- 下载大小:约 24.98 MB(24,984,327 字节)
数据划分
该数据集仅包含一个划分:
- 训练集(train):30 个样本
数据字段
数据集包含以下 5 个特征字段:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
audio |
audio | 音频数据 |
duration |
float64 | 音频时长(秒) |
language |
string | 语言标识 |
transcript_text |
string | 转写文本 |
flamingo_next_description |
string | Flamingo Next 生成的描述文本 |
数据集配置
- 配置名称:default
- 数据文件路径:
data/train-*(使用通配符匹配多个文件)
用途说明
该数据集包含音频样本及其对应的转写文本和自动生成的描述文本,适用于语音识别、音频描述生成或多模态模型训练等任务的研究与开发。




