univi-3M-v0
收藏资源简介:
该数据集是一个多模态数据集,包含两个配置:librispeech 和 librispeech_asr,推测与语音识别任务相关。数据以样本集合的形式组织,每个样本包含多个结构化字段:一个图像列表(images),一个多轮对话消息列表(messages,其中每条消息包含角色和内容,内容又包含类型和文本),以及标识数据来源、分割、行ID、渲染配置、模态标签、预处理版本等元数据字段。librispeech 配置仅包含验证集(validation),共5,567个样本;librispeech_asr 配置包含训练集(train),共28,539个样本。数据集适用于多模态理解、语音识别文本生成或对话系统等任务的研究与开发。
This dataset is a multimodal dataset containing two configurations: librispeech and librispeech_asr, and is inferred to be related to speech recognition tasks. The data is organized as a collection of samples, each containing multiple structured fields: an image list (images), a multi-turn dialogue message list (messages, where each message includes a role and content, with content further comprising type and text), and metadata fields identifying data source, split, row ID, rendering configuration, modality labels, preprocessing version, etc. The librispeech configuration includes only a validation set (validation) with 5,567 samples, while the librispeech_asr configuration includes a training set (train) with 28,539 samples. The dataset is suitable for research and development in tasks such as multimodal understanding, speech recognition text generation, or dialogue systems.
数据集概述:univi-3M-v0
该数据集包含两个配置,分别命名为 librispeech 和 librispeech_asr。数据集的托管地址为:https://huggingface.co/datasets/hungphongtrun/univi-3M-v0。
配置详情
配置:librispeech
- 数据集大小:约 2.30 GB (2,468,575,467 字节)。
- 下载大小:约 2.29 GB (2,455,521,169 字节)。
- 包含的拆分:
validation。- 验证集样本数:5,567 个。
配置:librispeech_asr
- 数据集大小:约 2.17 GB (2,326,446,338 字节)。
- 下载大小:约 17.98 GB (19,310,754,472 字节)。
- 包含的拆分:
train。- 训练集样本数:28,539 个。
数据特征(两个配置共享主要特征结构)
每个样本包含以下字段:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
images |
图像列表 (list: image) | 图像数据。 |
messages |
消息列表 (list) | 包含多轮对话内容。每条消息有 role (字符串) 和 content (列表) 字段。content 列表中的每个元素包含 type (字符串) 和 text (字符串)。 |
source_dataset_id |
字符串 | 源数据集的唯一标识符。 |
split |
字符串 | 数据拆分名称。 |
row_id |
字符串 | 行唯一标识符。 |
render_config |
字符串 | 渲染配置。 |
modality_label |
字符串 | 模态标签。 |
preprocessing_version |
字符串 | 预处理版本。 |
original_token_length |
整数 (int64) | 原始 token 长度。注意:此字段仅在 librispeech 配置中存在。 |
source_split |
字符串 | 源数据集的拆分名称。注意:此字段仅在 librispeech 配置中存在。 |



