open-vi-dialog-500h
收藏资源简介:
OpenVI Dialog Synthetic 500h 是一个越南语双说话人合成对话数据集,用于 ZipVoice-Dialog 实验。该数据集包含 60,000 个音频块,每个块时长 30 秒,总时长 500 小时。数据分为 5 个分片,每个分片约 100 小时。音频采用 FLAC 格式,并附带每个块的对话清单和轮次元数据。数据集由 OpenDialog v2 合成流水线生成,每个分片包含一个 manifest.jsonl 文件及其对应的 chunks/ 目录。
OpenVI Dialog Synthetic 500h is a Vietnamese dual-speaker synthetic dialogue dataset used for ZipVoice-Dialog experiments. The dataset contains 60,000 audio chunks, each lasting 30 seconds, with a total duration of 500 hours. The data is divided into 5 shards, each approximately 100 hours. Audio is in FLAC format, accompanied by dialogue manifests and turn metadata for each chunk. The dataset is generated by the OpenDialog v2 synthesis pipeline, with each shard containing a manifest.jsonl file and its corresponding chunks/ directory.
数据集概述:OpenVI Dialog Synthetic 500h
基本信息
- 语言:越南语(vi)
- 任务类别:文本转语音(text-to-speech)
- 数据规模:100K < n < 1M
数据集用途
该数据集专为ZipVoice-Dialog实验设计,包含越南语双说话人合成对话数据。
核心数据指标
- 音频块数量:60,000个,每个时长30秒
- 总时长:500小时
- 分片数量:5个分片,每片约100小时
- 音频格式:FLAC格式
数据组织与特性
- 每个音频块配有对应的对话清单(dialogue manifests)及轮次元数据(turn metadata)
- 每个分片包含一个
manifest.jsonl文件及对应的chunks/目录
生成方式
数据通过OpenDialog v2合成流水线(OpenDialog v2 synthesis pipeline)生成。





