遇见数据集

AudioChaps-Alignment; AudioChaps-CoT; AudioChaps-Eval

收藏
arXiv2026-08-17 更新2026-08-19 收录
数据链接:
官方服务:

资源简介:

AudioChaps数据集集合由萨里大学与华为诺亚方舟实验室联合创建,是首个专为音频章节化任务设计的综合性数据集,旨在通过强化学习对齐大型音频语言模型与人类编辑判断。该集合包含三个子集:AudioChaps-Alignment来源于YouTube创作者标注的章节边界,覆盖结构化语音、动态媒体、游戏及音乐四种声学场景;AudioChaps-CoT通过音频到文本模态桥接管道生成结构化推理轨迹,提供基于证据的监督信号;AudioChaps-Eval作为首个纯音频章节化基准测试集,用于评估模型泛化能力。数据集创建过程分为三个阶段:边界相关伪思维链生成、声学感知日志净化及最终合成,确保推理格式规范且证据充分。该数据集旨在解决媒体内容章节化这一关键挑战,推动音频流从连续无序向结构可导航的转型,为媒体编目、索引及分发等实际应用奠定基础。

The AudioChaps dataset collection, co-developed by the University of Surrey and Huawei Noah's Ark Lab, is the first comprehensive dataset specifically designed for audio chapterization tasks, aiming to align large audio language models with human editorial judgments via reinforcement learning. This collection includes three subsets: AudioChaps-Alignment, derived from chapter boundaries annotated by YouTube creators, covers four acoustic scenarios: structured speech, dynamic media, gaming, and music; AudioChaps-CoT generates structured reasoning trajectories through an audio-to-text modality bridging pipeline, providing evidence-based supervision signals; AudioChaps-Eval, as the first pure audio chapterization benchmark dataset, is used to evaluate model generalization capabilities. The dataset creation process consists of three stages: boundary-related pseudo-Chain-of-Thought generation, acoustic-aware log purification, and final synthesis, ensuring standardized reasoning formats and sufficient evidence. This dataset aims to address the critical challenge of media content chapterization, promoting the transformation of audio streams from continuous and unstructured to structurally navigable, and laying a foundation for practical applications such as media cataloging, indexing, and distribution.

创建时间:
2026-08-17
原始信息汇总

AudioChaps 数据集详情

名称:AudioChaps

类型:音频大语言模型的后训练框架

核心功能:该框架基于 GRPO(Group Relative Policy Optimization)算法,用于将现有的大型音频语言模型与创作者编写的编辑判断进行对齐,以支持媒体章节化(media chapterization)任务。

特点

  • 采用强化学习/策略优化方法(GRPO)进行模型微调与行为对齐。
  • 聚焦于媒体内容的自动章节切分与标注,服务于视频/音频的内容组织与导航。

用途:用于改进音频语言模型在媒体章节化任务上的表现,使其输出更符合创作者的编辑意图。

搜集汇总
数据集介绍
AudioChaps-Alignment; AudioChaps-CoT; AudioChaps-Eval 数据集图片
构建方式
AudioChaps数据集体系构建于YouTube创作者标注的章节边界之上,源自VidChapters-7M大规模视频语料。为覆盖多元声学场景,依据YouTube类别标签将内容分层为结构化语音、动态媒体、游戏及音乐四类声学子型。针对每个源视频,构建60秒正负样本片段:正样本包含一个随机位于片段中央20秒区间内的真实章节边界,确保前后各有至少20秒的声学上下文;负样本则严格取自单一章节内部并远离标注边界。训练集AudioChaps-Alignment包含约3万片段,其中正样本13,347个,负样本16,636个。在此基础上,通过新颖的音频到文本模态桥接管道生成AudioChaps-CoT推理语料,该管道依次执行伪思维链生成、声学感知日志净化及最终思维链合成,为模型提供格式规范、基于证据的推理监督。评测集AudioChaps-Eval则为视频级分割的留出测试集,含约1.6万片段及完整的整段音频评估数据。
特点
该数据集体系的核心特色在于其任务界定与构建策略。音频章节化本质上是主观编辑判断的建模问题,而非客观声学事件的检测,数据集精准捕捉了这一特性。四类声学子型的细致分层使模型得以在异构音频条件下接受训练与评估,突破了传统仅限语音的管道局限。AudioChaps-CoT语料通过模态桥接实现推理数据净化,既保留了与任务相关的声学线索,又避免了标签泄露,为监督微调提供了高质量、证据支撑的推理目标。AudioChaps-Eval作为首个专为纯音频章节化设计的基准,具备视频级隔离、平衡正负样本及全长度评估协议,支持对模型泛化能力的全面检验。此外,数据集的构建采用基于流的存在/缺失判定范式,避免了对时间戳精确预测的依赖,契合当前LALM的实际能力边界。
使用方法
AudioChaps数据集体系专为音频章节化任务的训练与评估设计。研究者可采用AudioChaps-Alignment中的标注数据作为GRPO强化学习的奖励信号来源,其中包含创作者标注的边界真值。AudioChaps-CoT语料则用于监督微调的冷启动阶段,输入为60秒音频片段及二元提问提示,要求模型在<think>标签内进行证据推理并在<answer>标签内输出选项。训练后的模型在AudioChaps-Eval上以片段级指标(准确率、精确率、召回率、F1)进行评估,亦可通过滑动窗口方式应用于完整音频流的边界检测,窗口设为60秒、步长20秒,连续正窗口合并为单一边界估计。这一方法使得不具原生长上下文能力的LALM也能完成任意时长的音频章节化任务,为多媒体内容的结构化导航提供了实用且可扩展的解决方案。
背景与挑战
背景概述
音频章节划分作为多媒体内容结构化的重要任务,旨在将连续音频流切分为语义连贯的章节,对于媒体编辑、档案索引和内容分发具有重大商业价值。然而,现有大型音频语言模型在标准化基准上表现优异,却难以胜任实际媒体工作流中的这一主观性任务。为此,萨里大学与华为诺亚方舟实验室的研究人员于2026年提出了AudioChaps框架,并构建了三个数据集:AudioChaps-Alignment、AudioChaps-CoT和AudioChaps-Eval。这些数据集依托YouTube创作者标注的章节边界,覆盖结构化语音、动态媒体、游戏和音乐四种声学场景,旨在推动端到端音频章节化研究,为媒体导航与检索奠定基础。
当前挑战
音频章节划分面临多重挑战。领域层面,章节边界由主观编辑判断而非客观声学事件界定,模型需在长音频上下文上进行顺序推理,并泛化至语音、音乐、游戏等异构声学场景。现有级联方案依赖ASR转录,在非语音内容上效果急剧退化。数据构建层面,需从VidChapters-7M中筛选并分层采样正负样本,确保声学上下文的充分性;同时,合成推理轨迹需经严格净化,避免标签泄漏,且需保证训练与测试集在视频级别的隔离,以评估模型的真实泛化能力。
常用场景
经典使用场景
AudioChaps系列数据集的核心应用集中于音频章节化任务,即从连续的音频流中自动划分出主题连贯的章节边界。该数据集通过构建正负样本(包含与不包含章节边界的60秒音频片段),并覆盖结构化语音、动态媒体、游戏和音乐四种声学场景,为端到端大型音频语言模型(LALM)提供训练与评估基准。经典使用方式包括基于GRPO的强化学习对齐、思维链(CoT)监督微调,以及作为零样本评估基准,推动模型从原始音频中学习编辑级的分割判断。
衍生相关工作
围绕AudioChaps数据集,衍生了一系列开创性工作,包括AudioChaps-R1-Zero与AudioChaps-R1模型的提出,它们分别展示了直接强化学习和两阶段训练(SFT+GRPO)的效能差异。相关研究进一步探索了跨骨干网络(如MOSS-Think)的泛化能力,验证了框架的通用性。此外,该数据集催生了音频章节化基准的构建、与ASR-LLM级联系统的对比分析,以及全时长音频解码策略的研究,为后续工作奠定了方法论和评估基础。
数据集最近研究
最新研究方向
AudioChaps系列数据集聚焦于音频章节化这一新兴前沿方向,旨在将连续音频流自动切分为主题连贯的章节,以契合媒体编辑的主观判断。该研究突破传统语音主导的局限,覆盖动态媒体、游戏、音乐及结构化语音等多元声学场景,通过构建大规模训练语料、思维链推理监督及独立评测基准,推动大型音频语言模型在真实媒体工作流中的落地应用。其核心创新在于利用GRPO强化学习对齐创作者标注的章节边界,显著提升章节检测的精度与召回,为音频内容的结构化导航与智能检索提供了坚实的数据基础与评测依据,对媒体归档、内容分发及个性化推荐领域具有深远意义。
相关研究论文
  • 1
    Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization萨里大学; 华为诺亚方舟实验室 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务