遇见数据集

HKUSTAudio/ISCSLP2026-CoT-TTS

收藏
Hugging Face2026-06-19 更新2026-06-21 收录
官方服务:

资源简介:

该数据集是为ISCSLP 2026 CoT-TTS挑战赛准备的,旨在支持上下文感知、表达性和思维链(CoT)引导的语音生成研究。数据来源于富含对话的媒体资源,包括电影、电视剧、广播剧和短剧,这些资源通常包含丰富的对话上下文、说话者互动、场景变化和情感变化。每个样本围绕一个目标话语组织,包括其前文对话上下文、参考语音、元数据和相应注释,使模型能够学习从上下文中推断合适的说话风格,而不仅仅依赖目标文本。数据集包含英语(约8.6K小时,54%,约1.62M片段)和中文(约7.4K小时,46%,约1.38M片段),总时长约16K小时,共约3.0M片段。音频文件以FLAC格式标准化,但保留了原始声学特性(如不同采样率、声道配置、响度水平、背景声音或环境噪声),以模拟真实声学条件,避免过度预处理假设。元数据和注释基于归一化和去噪的音频版本生成,以提高可靠性和准确性。

This dataset is prepared for the ISCSLP 2026 CoT-TTS Challenge, aiming to support research on context-aware, expressive, and Chain-of-Thought (CoT) guided speech generation. The data is sourced from dialogue-rich media resources including movies, TV series, radio dramas and short dramas, which typically contain abundant conversational context, speaker interactions, scene transitions and emotional shifts. Each sample is organized around a target utterance, comprising its preceding conversational context, reference speech, metadata and corresponding annotations, allowing models to learn to infer appropriate speaking styles from context rather than relying solely on the target text. The dataset includes English (approximately 8.6K hours, 54%, ~1.62M segments) and Chinese (approximately 7.4K hours, 46%, ~1.38M segments), with a total duration of around 16K hours and approximately 3.0M segments in total. Audio files are standardized in FLAC format, while original acoustic characteristics such as varying sampling rates, channel configurations, loudness levels, background sounds or ambient noise are retained to simulate real-world acoustic conditions and avoid over-preprocessing assumptions. Metadata and annotations are generated based on normalized and denoised audio versions to enhance reliability and accuracy.

提供机构:
HKUSTAudio
搜集汇总
数据集介绍
HKUSTAudio/ISCSLP2026-CoT-TTS 数据集图片
构建方式
该数据集源自影视剧、广播剧及短剧等富含对话的媒体资源,旨在为语境感知与推理引导的语音生成研究提供支持。构建时,以目标语句为核心,提取其前序对话上下文、参考语音、元数据及相应标注,形成一个完整样本。音频文件仅被标准化为FLAC格式,保留了原始录音的采样率、声道数、响度及环境噪声等真实声学特性,未进行激进降噪或归一化处理,以模拟自然对话场景。为确保标注可靠性,元数据与标注信息基于经过降噪与归一化的音频版本生成,展现了严谨的数据处理逻辑。
特点
该数据集囊括约16,000小时、300万条语料,涵盖英语与汉语,分布均衡,规模宏大。其核心亮点在于双音频目录设计:`dialogue_segments`提供基于说话人检测的干净语句级片段,便于精确分析;`continuous_segments`则保留上下文连续性,扩展了音频的前后区间,为建模交互语境提供丰富资源。每条样本包含详尽元数据,如说话人标签、情感标注、基于推理链的风格分析及声学特征,确保多维度信息的完整集成。
使用方法
用户可通过读取JSON元数据文件获取目标语句、历史对话、情感标签及推理文本等信息。具体流程为:加载元数据后,遍历`dialog_segments`作为上下文,提取`target_segment.text`作为合成文本,借助`ref_segment_id`定位参考音频以供音色建模,利用`segment_id`获取目标语音用于监督学习。若需进行推理引导的语音生成,可调用`cot_text`作为风格推断的输入。音频文件通过片段ID与元数据精确匹配,便于模型训练与评估。
背景与挑战
背景概述
ISCSLP2026-CoT-TTS数据集由香港科技大学Weizhen Bian等人创建,专为ISCSLP 2026 CoT-TTS挑战赛设计,旨在推动上下文感知、富有表现力且基于思维链(CoT)引导的语音生成研究。该数据集发布于2026年,从影视剧、广播剧等多源媒体中采集,涵盖约1.6万小时、300万个样本的双语语音片段。其核心价值在于将先前的对话上下文、角色交互、场景变化与情感波动纳入语音生成模型的学习框架,突破了传统TTS仅依赖文本的局限,为高表现力语音合成领域提供了高质量、大规模的研究基准,对推动语音人机交互的智能化发展具有重要影响力。
当前挑战
该数据集首要解决的领域问题在于如何从多轮对话上下文中自动推断目标语句的语音风格,包括语气、情感和强调等,以克服传统TTS缺乏上下文感知能力的瓶颈。在构建过程中,面临多重挑战:一是从影视剧等自然场景中提取的音频保留了真实的环境噪声、背景音乐和声道差异,预处理策略的选择考验研究者对鲁棒性的把控;二是说话人标签仅自动生成且为匿名标记,转录、时间戳、情感标签及CoT风格注释均可能含错误,需谨慎参考;三是数据集版权受限,严格限定非商业学术用途,防止原始来源复原或身份识别,这要求使用者遵守伦理规范,避免滥用生成内容进行欺诈或冒犯。
常用场景
经典使用场景
ISCSLP2026-CoT-TTS数据集专为上下文感知与思维链引导的语音合成研究而构建,其经典使用场景聚焦于从对话历史中推断目标语句的表达风格。研究者可通过加载元数据中的对话上下文、目标文本、参考语音及思维链式注释,驱动模型生成具有恰当情感韵律、说话人一致性及场景适应性的合成语音。该设计使模型超越传统仅依赖文本输入的限制,在影视、广播剧等蕴含丰富交互与情绪变化的语料基础上,学习如何将对话语境中的语用信息动态映射为声学参数。
实际应用
在实际应用层面,该数据集可显著赋能情感化有声读物生成、智能语音助手的多轮对话生成、影视配音辅助创作以及虚拟角色声音扮演等场景。通过利用其保留的真实环境噪声、混响及非标准化声学条件,开发者能够训练出更具鲁棒性且适配复杂声学环境的模型,进而提升产品在戏剧、广播、短视频等媒体内容制作中的实用价值,使合成的语音在情绪表达与背景融合上更贴近自然录制效果。
衍生相关工作
基于该数据集,研究者已衍生出多项重要工作,包括上下文双编码器TTS架构、基于思维链的语音风格规划网络以及多模态情感韵律预测模型。这些工作共同推进了从离散对话标签到连续声学参数的透明映射,并借鉴大语言模型中的推理链思想,将对话分析结果作为显式中间表征引导语音生成。此外,该数据集也为跨语言表现力迁移、低资源场景下的韵律建模提供了基准平台,催生了大量关于上下文长度、说话人转换边界与情感连续性之间交互影响的深入分析研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务