遇见数据集

AnyAudio-Judge Bench and AnyAudio-Judge Corpus

收藏
github2026-06-02 更新2026-06-08 收录
官方服务:

资源简介:

AnyAudio-Judge 是一个基于动态评分标准的音频指令跟随基准和评估器。它包含两个核心数据集:AnyAudio-Judge Bench 是一个双语(英文/中文)多领域基准数据集,每个语言有7,920个样本,覆盖7个子集(speech、speech_gen、sound、sound_gen、music、music_gen、mix),并包含精心构建的困难负样本;AnyAudio-Judge Corpus 是一个包含105K样本的SFT训练集,带有明确的思维链推理和每个评分的二元标签。

AnyAudio-Judge is an audio instruction-following benchmark and evaluator based on dynamic scoring criteria. It consists of two core datasets: AnyAudio-Judge Bench is a bilingual (English/Chinese) multi-domain benchmark dataset with 7,920 samples per language, covering 7 subsets including speech, speech_gen, sound, sound_gen, music, music_gen, and mix, and includes carefully curated hard negative samples; AnyAudio-Judge Corpus is an SFT training set containing 105K samples, and is equipped with explicit chain-of-thought reasoning and binary labels for each scoring criterion.

创建时间:
2026-05-26
原始信息汇总

数据集概述:AnyAudio-Judge

AnyAudio-Judge 是一个基于**动态评分标准(Dynamic Rubric)**的音频指令遵循能力评测基准与评估器。它旨在替代传统单一的整体匹配/不匹配判断,通过将指令分解为多个独立、可验证的二元评分项,汇总各项概率,最终生成可解释的对齐分数。

核心组成

该仓库包含以下四个主要部分:

  1. AnyAudio-Judge Bench(评测基准)

    • 一个双语(英文/中文)多领域基准测试集。
    • 每种语言包含 7,920 个样本,分为 speech, speech_gen, sound, sound_gen, music, music_gen, mix 共 7 个子集。
    • 刻意构建了困难负样本(hard negatives),正负样本比例严格为 1 : 1
    • 负样本通过指令交换属性扰动两种方式构造。
  2. AnyAudio-Judge Corpus(训练语料库)

    • 一个包含 105K 样本的 SFT(监督微调)训练集。
    • 每个样本附带显式的思维链(Chain-of-Thought)推理过程和每条评分标准的二元标签。
  3. AnyAudio-Judge Models(评估模型)

    • 提供两个训练好的评估模型:
      • AnyAudio-Judge-7B:基于 Qwen2.5-Omni-7B 初始化。
      • AnyAudio-Judge-30B:基于 Qwen3-Omni-30B-A3B-Captioner 初始化(论文中报告的模型)。
  4. 推理与评估代码

    • 提供可复现评分标准分解、评估和基准测试评分的脚本。

关键资源链接

资源 HuggingFace 链接
基准测试集 (en + zh) https://huggingface.co/datasets/cucl2/AnyAudio-Judge-Bench
训练语料库 https://huggingface.co/datasets/cucl2/AnyAudio-Judge-Corpus
评估模型 (7B) https://huggingface.co/cucl2/AnyAudio-Judge-7B
评估模型 (30B) https://huggingface.co/cucl2/AnyAudio-Judge-30B

动态评分标准范式(Dynamic Rubric Paradigm)

对于给定的音频-指令对 (a, i),评估流程分三步:

  1. 分解:使用大语言模型(论文中使用 Qwen3-30B-A3B-Instruct-2507)将指令 i 分解为 n 个原子化的、可验证的“是/否”评分项 {p_1, ..., p_n}
  2. 评估:使用音频-语言模型评估每个评分项 p_j。通过读取“yes”和“no”答案标记的 logits 值,计算软满足概率 p_j^yes
  3. 聚合:将所有评分项的软概率取平均值,得到整体对齐分数 s = (1/n) * sum_j p_j^yes

每个评分项还附带简短的理由(evidence),提供可解释的、细粒度的诊断结果。

基准测试子集详情

子集 样本数(每种语言) 描述
speech 1,200 真实语音,从 InstructTTSEval 中筛选
speech_gen 2,000 由 Qwen3-TTS / MOSS-VoiceGen / MiMo-Audio 合成
sound 1,000 来自 Clotho v2 的真实音效
sound_gen 1,200 由 AudioGen / AudioLDM2 / Stable Audio 合成
music 720 来自 Song Describer 的真实音乐
music_gen 800 由 MusicGen / ACE-Step / Stable Audio 合成
mix 1,000 约1分钟的真实电影混合音频
总计 7,920 ×2 (en/zh)

基准测试中每行数据包含:uuid(唯一ID)、audio(音频)、caption(指令)、label(标签“yes”/“no”)、type(类型)、subset(子集)、rubric(评分标准列表,包含维度、问题、依据)。

主要结果(AnyAudio-Judge Bench 上的准确率)

模型 英文平均准确率 中文平均准确率
AnyAudio-Judge (本文) 84.45 85.26
Gemini-2.5-Pro 77.72 80.01
Qwen3-Omni-30B-A3B-Instruct 77.34 76.82
Kimi-Audio-7B-Instruct 70.81 70.84

安装与使用

  • 环境要求:Python ≥ 3.10。

  • 安装命令: bash git clone https://github.com/CuCl-2/AnyAudio-Judge.git cd AnyAudio-Judge pip install -r requirements.txt

  • 快速开始:提供了一个三阶段流水线(分解、清理、评估),可通过 anyaudio_judge 库调用。

    • decompose_instruction() 函数用于将指令分解为评分项。
    • AnyAudioJudge 类用于评估音频。支持 logits(默认,输出连续分数,适合作为RL奖励)和 generate(输出离散“是/否”答案及证据)两种模式。

许可证

  • 代码:Apache-2.0。
  • 评估基准和语料库:音频数据源自公开数据集,使用前请查阅上游许可证。
  • 模型权重:Apache-2.0,继承自基础 Qwen 模型。
搜集汇总
数据集介绍
AnyAudio-Judge Bench and AnyAudio-Judge Corpus 数据集图片
构建方式
在基于指令的音频生成任务中,传统的整体式评估范式往往难以捕捉细粒度的语义对齐。为此,AnyAudio-Judge 提出了一种动态评分细则(dynamic rubric)评估方法,在双语(英文/中文)及多领域(语音、音效、音乐等)框架下构建了包含 7,920 个样本的评估基准(AnyAudio-Judge Bench)。其构建过程包括三个关键步骤:首先利用语言模型将每条指令动态分解为若干个原子化的、可独立验证的二元问题(即评分细则);接着借助音频语言模型评估每个细则,利用输出层逻辑值计算软概率;最后将各项概率取均值以汇聚为一个具可解释性的对齐分数。每个子集维持 1:1 的正负样本比,并通过指令交换和属性扰动生成语义不匹配的困难负样本,从而实现更严谨的评测。
使用方法
使用 AnyAudio-Judge 需依次完成指令分解、细则清洗与音频评判三个阶段。首先,调用 decompose_instruction 函数,通过选择对应子集(speech、sound、music 或 mix)的系统提示词,基于语言模型将指令转化为二元细则,并可启用幻觉过滤(clean=True)以移除细则中未出现在原指令中的内容。随后,使用 AnyAudio-Judge 模型(7B 或 30B)对音频与细则进行评判,模式分为 logits(每细则独立推理,输出连续性分数,适合作为强化学习奖励)与 generate(一次生成所有答案与证据,离散加速)。用户亦可借助 evaluate_benchmark.py 脚本在预置基准上直接复现论文评测结果,运行简便,无需重复推理分解步骤。
背景与挑战
背景概述
AnyAudio-Judge由匿名研究团队于2026年提出,旨在解决指令引导音频生成任务中缺乏细粒度、可解释评估标准的核心问题。传统评估方法多依赖整体匹配判定,难以捕捉生成结果在指令各维度上的符合程度。该数据集包含AnyAudio-Judge Bench双语基准(英/中,各7920样本)和AnyAudio-Judge Corpus(10.5万训练样本),覆盖语音、音效、音乐及混合音频七大子集,通过精心构造的硬负样本(指令交换、属性扰动)提升评估难度。其动态规则评估范式将指令解构为独立可验证的二元条目,为音频-指令对齐提供连续可解释的评分,推动评估从单一判决向多维度推理演进。
当前挑战
该数据集面临的核心挑战在于:领域层面,音频生成任务中指令语义的复杂性与多模态对齐的模糊性导致现有评估方法难以捕捉局部细节偏差(如方言、乐器、情绪等属性扰动),且缺乏双语跨文化指令理解的统一基准。构建过程中,需解决人工标注成本高昂与负样本真实性平衡的矛盾,通过自动指令交换与属性扰动生成的负样本可能引入语义不清或伪负面案例;同时,规则分解依赖大语言模型的幻觉过滤能力,当分解条目被全部移除时退化为整体评估,削弱动态规则范式的优势。此外,105K规模训练集需确保跨域、跨语言标注的一致性与细粒度证据链的完备性,对数据质量控制构成严峻考验。
常用场景
经典使用场景
在音频指令跟随(Audio Instruction Following)研究领域,AnyAudio-Judge Bench被广泛用于评估多模态大模型在细粒度音频-文本对齐任务上的表现。该基准涵盖语音、声音效果、音乐及混合音频七大子集,每子集均以严格1:1的正负样本比例构造,负样本通过指令交换与属性扰动精心生成,从而模拟真实场景下模型对指令中细微语义变更(如方言、情感、乐器变化)的敏感度。研究者常利用该基准检验音频理解模型在独立、可验证的二元评分项上的逐项判断能力,进而获得可解释的对齐分数。
解决学术问题
该数据集系统性地解决了传统音频-文本评估中粗粒度二分类(匹配/不匹配)难以定位模型失败原因的问题。通过动态评分项分解范式,AnyAudio-Judge将复杂指令自动拆解为多个原子化、可验证的二进制问题,使评估不再依赖单一全局判断,而是从性别、语气、背景音等多维度量化音频与指令的契合程度。这一机制有效剖析了生成模型中常见的语义漂移、属性遗漏和幻觉现象,为音频指令跟随提供了更具诊断性的评估框架,推动了多模态对齐度量的精细化和科学化。
实际应用
在实际应用中,AnyAudio-Judge Corpus和评估模型可部署于智能语音助手、音频内容审核、辅助听觉设备等场景。例如,当用户要求生成“带有轻柔女声和钢琴背景的音效”时,系统能自动解析指令为说话人性别、声调、乐器存在性等独立检查项,然后逐项验证生成音频是否满足每一子要求,并输出细粒度的符合度报告。这显著提升了面向生产环境的音频生成质量监控能力,可用于自动化质量保证、用户反馈诊断及迭代式模型优化,尤其适合需要高可靠性的专业音频制作与交互式媒体生成。
数据集最近研究
最新研究方向
针对指令引导音频生成任务中评估范式单一、缺乏可解释性的痛点,AnyAudio-Judge首次引入动态评分细则(Dynamic Rubric)评估框架,通过大语言模型将指令逐级拆解为可独立验证的二元子项,并结合音频语言模型的软概率聚合输出可解释的对齐分数。该研究构建了包含双语7,920样本的精细评测基准(AnyAudio-Judge Bench)与105K规模的思维链监督微调语料库(AnyAudio-Judge Corpus),推动音频理解与生成评估从粗糙的全局匹配迈向细粒度、可诊断、可归因的新阶段。其训练的两个评估模型在硬负例和跨领域(语音、音效、音乐、混合音频)场景中均显著超越现有方法,为音频AI系统的鲁棒性验证与奖励建模提供了范式级工具,与当前多模态模型评估标准化、可解释化的发展趋势紧密契合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务