遇见数据集

open-vi-dialog-500h

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

OpenVI Dialog Synthetic 500h 是一个越南语双说话人合成对话数据集,用于 ZipVoice-Dialog 实验。该数据集包含 60,000 个音频块,每个块时长 30 秒,总时长 500 小时。数据分为 5 个分片,每个分片约 100 小时。音频采用 FLAC 格式,并附带每个块的对话清单和轮次元数据。数据集由 OpenDialog v2 合成流水线生成,每个分片包含一个 manifest.jsonl 文件及其对应的 chunks/ 目录。

OpenVI Dialog Synthetic 500h is a Vietnamese dual-speaker synthetic dialogue dataset used for ZipVoice-Dialog experiments. The dataset contains 60,000 audio chunks, each lasting 30 seconds, with a total duration of 500 hours. The data is divided into 5 shards, each approximately 100 hours. Audio is in FLAC format, accompanied by dialogue manifests and turn metadata for each chunk. The dataset is generated by the OpenDialog v2 synthesis pipeline, with each shard containing a manifest.jsonl file and its corresponding chunks/ directory.

创建时间:
2026-08-26
原始信息汇总

数据集概述:OpenVI Dialog Synthetic 500h

基本信息

  • 语言:越南语(vi)
  • 任务类别:文本转语音(text-to-speech)
  • 数据规模:100K < n < 1M

数据集用途

该数据集专为ZipVoice-Dialog实验设计,包含越南语双说话人合成对话数据。

核心数据指标

  • 音频块数量:60,000个,每个时长30秒
  • 总时长:500小时
  • 分片数量:5个分片,每片约100小时
  • 音频格式:FLAC格式

数据组织与特性

  • 每个音频块配有对应的对话清单(dialogue manifests)及轮次元数据(turn metadata)
  • 每个分片包含一个manifest.jsonl文件及对应的chunks/目录

生成方式

数据通过OpenDialog v2合成流水线(OpenDialog v2 synthesis pipeline)生成。

搜集汇总
数据集介绍
open-vi-dialog-500h 数据集图片
构建方式
该数据集源于越南语双说话人合成对话的构建需求,旨在为ZipVoice-Dialog实验提供规模化训练素材。其构建依托OpenDialog v2合成流水线,生成了总计500小时、包含60,000个时长30秒的音频片段。数据被划分为五个分片,每片约100小时,以FLAC格式存储音频,并辅以逐片段对话清单与轮次元数据,确保每条语音样本具备完整的上下文信息。
特点
该数据集的核心特性在于其规模与结构设计。500小时的总时长与双说话人对话形式,契合多说话人语音合成与对话系统的研究需求。每段30秒的音频切分粒度,便于模型处理短时交互;而分片存储与FLAC无损压缩,兼顾了数据加载效率与音质保真。对话清单与轮次元数据的嵌入,为语音韵律建模和说话人转换研究提供了细粒度的标注支持。
使用方法
使用时,研究人员可依据五个分片目录分别加载数据,每个分片包含manifest.jsonl与chunks子目录。通过读取manifest文件可获取每个音频片段的对话语义及说话人轮次信息,进而与音频文件配对,用于训练端到端文本到语音模型或对话语音生成系统。数据格式与通用语音处理工具链兼容,便于直接集成至现有训练流程,开展跨语言或特定说话人风格的合成实验。
背景与挑战
背景概述
OpenVI Dialog Synthetic 500h 数据集由越南语研究团队于近年构建,旨在为 ZipVoice-Dialog 项目提供高质量的语音对话合成资源。该数据集包含 500 小时的越南语双说话人合成对话,分为五个约100小时的子集,共60,000个30秒的音频块,每个块均附有详细的对话清单和话轮元数据,并以 FLAC 格式存储。其核心研究问题在于推动多说话人语音对话合成技术的发展,特别是在低资源语言场景下,为文本到语音(TTS)系统提供大规模、可控的对话数据。该数据集的发布填补了越南语对话语音数据稀缺的空白,为相关领域的研究人员提供了宝贵的实验基础,对越南语语音合成和语音交互系统的研究具有重要的推动作用。
当前挑战
OpenVI Dialog Synthetic 500h 数据集面临的挑战主要体现在两个层面:其一,针对领域问题,越南语作为低资源语言,其对话语音数据匮乏,严重制约了多说话人 TTS 系统的训练与性能提升,该数据集通过合成方式提供了大规模对话数据,但合成语音的自然性和韵律多样性仍需验证,如何确保合成数据与真实语音之间的域差距不对下游任务造成负面影响,是当前研究的重点;其二,在构建过程中,生成如此规模的对话数据需要复杂的流水线(OpenDialog v2),包括语音分割、话轮标注、韵律控制等环节,如何保证每个 30 秒音频块内两个说话人语音的清晰分离与自然过渡,同时维持 500 小时数据的连续性和一致性,是构建时的关键难点。此外,数据的元数据标注准确性,以及五个分片之间的平衡性,也构成技术上的挑战。
常用场景
经典使用场景
该数据集在文本到语音(TTS)领域内,专为多说话人对话场景的语音合成研究而构建。其核心应用在于训练与评估能够生成自然、流畅且具有角色区分度的双人对话语音的神经TTS模型。凭借其精心设计的双说话人结构与精细的轮次元数据,该数据集为探索对话韵律、情感表达及交互时序等复杂声学特征提供了理想的实验平台,支持研究者开发新一代的对话式语音合成系统。
衍生相关工作
该数据集的发布,预期将催生一系列相关联的学术研究工作。基于其结构,研究者可能致力于开发对话场景下的语音风格迁移模型,利用说话人元数据实现音色的可控变换;亦可能衍生出针对对话韵律的建模方法,探索如何从文本语义和对话历史中预测并合成恰当的重音与语调。此外,该数据集亦为无监督或自监督的说话人表征学习提供了丰富原料,相关研究可能进一步探索如何利用对话结构来提升语音分离、说话人日志等上游任务的性能,形成了数据驱动的、辐射多项语音研究分支的良性学术生态。
数据集最近研究
最新研究方向
OpenVI Dialog Synthetic 500h数据集聚焦于越南语双说话人合成对话语音,为文本到语音(TTS)领域的前沿研究提供了规模化、精细化的数据支撑。该数据集包含500小时、6万段各30秒的音频片段,并通过OpenDialog v2流水线生成,其分片设计与逐句元数据标注为多轮对话语音合成、说话人转换及韵律建模等方向注入了新动力。在语音合成技术向高自然度、强交互性迈进的当下,该数据集对于推动多说话人对话场景下的神经TTS模型训练、评估与鲁棒性提升具有重要价值,同时为跨语言对话合成系统及低资源语音研究提供了宝贵的基准资源,助力越南语及同类语种的智能语音交互应用迈向更真实、更流畅的体验。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务