遇见数据集

Bagpiper_TTS_SFT_Data

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

Bagpiper-TTS SFT Data 是一个为支持 Bagpiper-TTS 通用语音合成模型而构建的监督微调数据集。该数据集能够解释自由形式的自然语言请求,规划所需的输出,生成丰富的文本字幕,并合成目标音频。数据集以 Parquet 格式组织,所有样本自包含,每条记录包含用户请求、模型规划/字幕文本以及完整的编码音频字节,无需外部音频查找。数据集按论文中使用的六个应用场景划分:classical_tts(显式文本+自然语言语音和表达指令)、multi_talker(多说话人对话,含每个说话人特征)、intent_to_speech(传达交际意图,无需精确措辞)、role_play(角色/人物驱动的表现性语音)、svs(歌唱语音合成,含歌词和音乐指令)和 general_purpose(开放语音场景和非标准请求)。数据集总共有 738,123 行,分布在 1,151 个分片中,Parquet 数据约 253 GB,嵌入音频约 295.5 GB。数据构建流程包括从策划语音或歌唱音频出发,生成丰富字幕,提取或验证转录,过滤转录错误,反向模拟多样化自然语言请求,构建三部分规划轨迹,并应用一致性过滤。该数据集旨在用于研究指令跟随语音合成,不应被描述为语音克隆数据集或系统。已知限制包括:丰富字幕和模拟规划可能产生幻觉属性或内容;六个应用来源和过滤规则不同;部分原始来源存在未解决的重分发条款;可能包含合成或变换音频以及机器生成文本;未彻底审核个人信息、不安全内容、攻击性语言或受版权保护的文本/歌词。

Bagpiper-TTS SFT Data is a supervised fine-tuning dataset built to support the Bagpiper-TTS general-purpose speech synthesis model. This dataset can interpret free-form natural language requests, plan the required output, generate rich text captions, and synthesize target audio. The dataset is organized in Parquet format, with all samples self-contained; each record contains the user request, model planning/caption text, and complete encoded audio bytes, without the need for external audio lookup. The dataset is divided into six application scenarios used in the paper: classical_tts (explicit text + natural language voice and expression instructions), multi_talker (multi-speaker dialogue with speaker characteristics), intent_to_speech (conveying communicative intent without precise wording), role_play (character-driven expressive speech), svs (singing voice synthesis with lyrics and music instructions), and general_purpose (open speech scenarios and non-standard requests). The dataset has a total of 738,123 rows distributed across 1,151 shards, with Parquet data approximately 253 GB and embedded audio approximately 295.5 GB. The data construction process includes starting from curated speech or singing audio, generating rich captions, extracting or verifying transcripts, filtering transcription errors, reverse-simulating diverse natural language requests, constructing three-part planning trajectories, and applying consistency filtering. This dataset is intended for research on instruction-following speech synthesis and should not be described as a voice cloning dataset or system. Known limitations include: rich captions and simulated planning may produce hallucinated attributes or content; six application sources and filtering rules differ; some original sources have unresolved redistribution terms; may contain synthetic or transformed audio and machine-generated text; personal information, unsafe content, offensive language, or copyrighted text/lyrics have not been thoroughly reviewed.

提供机构:
ESPnet
创建时间:
2026-08-02
原始信息汇总

Bagpiper-TTS SFT Data 数据集详情

数据集概览

Bagpiper-TTS SFT Data 是一个用于支持 Bagpiper-TTS 通用语音合成模型的指令微调数据集。该模型能够解析自由形式的自然语言请求、规划所需的语音输出、生成丰富的文本描述,并合成目标音频。

  • 语言:英语
  • 任务类别:文本转语音(text-to-speech)、文本转音频(text-to-audio)
  • 数据规模:100K < n < 1M(总计 738,123 行)

数据组织方式

数据集按论文中使用的六种应用场景进行组织:

配置名称 能力描述
classical_tts 带有自然语言声音和表达指令的显式文本转语音
multi_talker 多说话人对话,支持各说话人特征设置
intent_to_speech 无需精确措辞即可传达交流意图的语音生成
role_play 角色/人物驱动的表现性语音
svs 带歌词和音乐指令的歌声合成
general_purpose 开放式语音场景和非常规请求

数据结构与加载方式

  • 每条数据自包含:请求文本、规划/描述文本以及完整的编码音频字节均存储在同一 Parquet 行中,无需外部音频查找或表连接。
  • 数据被切分为多个确定性 Parquet 分片,每个分片约 256 MiB
  • 训练对话不包含系统消息,每行按 user:text → assistant:text → assistant:audio 顺序排列。
  • 所有 738,123 行数据中,原始暂存 JSONL 中的任务特定系统消息已被统一移除。
  • 推荐使用流式加载方式读取数据,可以通过指定 Parquet 文件的 glob 模式加载(例如 hf://datasets/espnet/Bagpiper_TTS_SFT_Data/intent_to_speech/*.parquet)。

发布统计

应用分区 行数 分片数 Parquet 字节数 嵌入式音频字节数
classical_tts 235,279 241 52,899,149,925 57,191,194,377
multi_talker 64,659 170 38,632,502,383 44,989,933,724
intent_to_speech 153,568 325 68,640,618,698 85,622,064,832
role_play 47,116 107 22,456,138,107 28,130,403,188
svs 101,887 120 29,503,615,421 31,274,125,012
general_purpose 135,614 188 40,849,052,445 48,322,109,074
总计 738,123 1,151 252,981,076,979 295,529,830,207

classical_tts 分区包含:LibriTTS-R clean-100(17,656 行)、clean-360(60,657 行)、other-500(103,267 行)、Genshin(40,793 行)和 Star Rail(12,906 行)。

数据构建流程

数据构建流程包括以下步骤:

  1. 从精选的语音或歌声音频出发
  2. 创建详细的丰富描述(rich caption)
  3. 提取或验证转录文本
  4. 过滤转录错误
  5. 反向模拟多样化的自然语言请求
  6. 构建三部分规划轨迹
  7. 应用一致性过滤

论文使用 Qwen3-235B-A22B-Instruct-FP8 作为主要文本处理器,并可选使用 Gemini 进行音频验证。

预期用途与限制

预期用途:该数据集用于指令跟随语音合成的研究。Bagpiper-TTS 仅使用文本请求,不接受参考音频,因此不应被描述为语音克隆数据集或系统。

已知限制

  • 丰富的描述和模拟规划可能产生属性或内容幻觉
  • 六种应用场景的数据来源和过滤规则存在异质性
  • 部分原始源语料存在未解决的分发条款问题,在权利确认前相关示例将被扣留
  • 游戏衍生语音、歌唱素材和基准/评估资产需要特别谨慎处理
  • 数据可能包含合成或变换的音频以及机器生成的文本,而非专家标注
  • 语料未经全面审核,可能存在个人信息、不安全内容、冒犯性语言或受版权保护的文本/歌词

相关资源

搜集汇总
数据集介绍
Bagpiper_TTS_SFT_Data 数据集图片
构建方式
在指令遵循语音合成研究兴起的背景下,该数据集以经过筛选的语音与歌唱音频为起点,通过自动化流水线构建监督微调语料。具体而言,构建者先为每段音频生成细节丰富的描述性字幕,并提取或校验其转写文本,继而滤除转写错误;随后反向模拟多样化的自然语言请求,构造包含请求解析、交付规划与字幕生成的三段式规划轨迹,最后施加一致性过滤以确保文本与音频语义对齐。主文本处理器为Qwen3-235B-A22B-Instruct-FP8,并可选地借助Gemini进行音频验证。
特点
数据集覆盖六类应用配置,分别为经典文本转语音、多人对话、意图到语音、角色扮演、歌声合成与通用目的,总量达七十三万余行,内含约二十九万兆字节的嵌入式音频。每行样本自包含请求、规划与字幕文本以及完整编码的音频字节,无需外部查表或联接;训练对话有意省略系统消息,遵循“用户文本→助手文本→助手音频”的顺序。各来源语料保留为溯源字段,且允许有效音频在不同行间复用,分片以约二百五十六兆字节为粒度确定性地切分。
使用方法
使用该数据集时可借助datasets库加载Parquet格式,由于命名配置尚未启用,需显式指定某一应用目录下的Parquet通配路径,并推荐采用流式模式以降低内存压力。加载后,每行样本可直接通过键访问音频字节与对应文本,无需额外音频检索或表连接。该数据面向指令遵循语音合成的研究用途,文本请求而不接受参考音频,故不应被描述为声音克隆数据集或系统。
背景与挑战
背景概述
语音合成领域长期依赖参考音频或固定说话人标识,难以泛化至开放场景。Bagpiper-TTS SFT Data由Jinchuan Tian、Shinji Watanabe等学者依托卡内基梅隆大学及ESPnet社区构建,旨在支撑Bagpiper-TTS这一通用语音合成模型,使其能够解析自由形式的自然语言请求、规划表达方式并合成目标音频。该数据集涵盖经典语音合成、多说话人对话、意图驱动合成、角色扮演、歌声合成及通用场景六大应用,包含逾七十三万条训练样本,为指令跟随式语音合成研究提供了大规模、多任务的监督数据基础,推动了语音生成从单一任务向开放式音频任务求解的范式转变。
当前挑战
该数据集所应对的核心领域挑战在于:传统语音合成系统无法理解并执行以自然语言描述的丰富表达意图,而现有指令语音数据集多局限于单一任务或少量说话人,难以支撑开放域、多场景的通用合成。构建过程中的挑战则体现为多重数据质量与合规性的张力。丰富描述与模拟规划可能引入属性或内容幻觉,六个应用的数据来源与过滤规则异质,部分原始语料的再分发条款尚未明确,游戏衍生音色、歌声素材及评测资产尤需审慎处理。此外,数据可能包含合成或变换音频以及机器生成文本,且未针对个人信息、不当内容、冒犯性语言或受版权保护的歌词进行穷尽审核,这些因素共同构成了数据集可靠性与合法使用的现实约束。
常用场景
经典使用场景
在指令遵循语音合成的研究范式中,该数据集最经典的使用场景是支撑Bagpiper-TTS这一通用语音合成模型的监督微调。模型接收自由形式的自然语言请求,经由规划器生成包含交付方式的文本描述,再合成目标音频。数据集涵盖古典TTS、多说话人对话、意图到语音、角色扮演、歌声合成与通用场景六大配置,每一行数据均以用户文本、助手文本与助手音频的三元组形式自包含存储,便于流式加载与端到端训练。
衍生相关工作
以该数据集为基石,Bagpiper-TTS模型及其基础模型Bagpiper相继问世,后者在第三届语言建模会议上提出以丰富描述解决开放式音频任务的框架。相关研究进一步探索了无系统提示的对话式语音合成训练范式、基于大语言模型的语音规划器设计,以及跨说话人与跨风格的零样本语音生成。这些工作共同拓展了指令跟随语音合成的边界,并激发了歌声合成与角色扮演语音等细分方向的后续研究。
数据集最近研究
最新研究方向
在语音合成领域,面向自由形式自然语言指令的通用TTS模型正成为前沿探索方向,Bagpiper-TTS SFT数据集通过意图到语音、角色扮演、歌唱合成等六类应用配置,为指令跟随型语音生成提供了大规模监督信号。该数据集回应了当前多模态音频任务中从精确文本朗读向 communicative intent 建模的范式转变,其构建流程借助大语言模型生成丰富描述与规划轨迹,并引入一致性过滤,支撑起无需参考音频、仅凭文本请求即可规划并合成目标语音的新范式。研究工作聚焦于提升模型对开放式语音场景的泛化理解能力,同时关注合成语音中的版权与伦理风险,推动建立更透明的数据溯源与合规使用规范,对语音交互、虚拟角色及辅助创作等应用具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务