遇见数据集

temporal-lalm

收藏
Hugging Face2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

Temporal LALM (Relative Temporal MCQA) 是一个用于评估大型音频语言模型在相对时序推理能力上的多选题数据集。其核心任务是基于给定的音频片段,回答关于其中声音事件相对时序关系的选择题,具体包括判断哪个声音事件开始最早(earliest_start)、哪个结束最晚(latest_end)以及哪个持续时间最长(longest_duration)。该数据集构建于 TACOS 音频集合之上,共包含 1,657 道多选题,涵盖三个子任务,其中 earliest_start 任务有 528 题,latest_end 有 499 题,longest_duration 有 630 题。这些题目基于 718 个唯一的音频片段生成,每个音频片段可能被用于多个不同任务。数据集中每个任务的正确答案选项分布接近均匀,以平衡选项偏差。每条数据样本包含解码后的音频数据、原始音频文件名、问题文本、四个选项文本、正确答案对应的字母、正确答案的完整文本以及所属的任务标签。该数据集适用于音频分类、问答等任务,特别用于研究和评测模型在理解音频中事件时序关系方面的能力。

Temporal LALM (Relative Temporal MCQA) is a multiple-choice dataset developed to evaluate the relative temporal reasoning capabilities of large audio-language models. Its core task involves answering multiple-choice questions regarding the relative temporal relationships between sound events within a given audio clip, specifically including identifying which sound event has the earliest start time (earliest_start), the latest end time (latest_end), and the longest duration (longest_duration). This dataset is constructed based on the TACOS audio corpus, containing a total of 1,657 multiple-choice questions across three subtasks: 528 for the earliest_start task, 499 for the latest_end task, and 630 for the longest_duration task. These questions are generated from 718 unique audio clips, and each audio clip may be used for multiple distinct tasks. The distribution of correct answer options for each task in the dataset is nearly uniform to mitigate option bias. Each data sample includes decoded audio data, the original audio filename, the question text, four option texts, the letter corresponding to the correct answer, the full text of the correct answer, and the associated task tag. This dataset is applicable to tasks such as audio classification and question answering, and is specifically designed for researching and evaluating models' ability to understand temporal relationships between events in audio.

创建时间:
2026-06-14
原始信息汇总

Temporal LALM (Relative Temporal MCQA) 数据集概述

该数据集是一个用于评估大型音频语言模型(LALMs)在音频片段中进行相对时间推理能力的多选题(MCQA)数据集。它基于 TACOS 音频集合构建。

  • 任务与规模:包含三个核心任务,共计 1657 个多选题。

    • earliest_start (528题):判断哪个声音事件开始最早
    • latest_end (499题):判断哪个声音事件结束最晚
    • longest_duration (630题):判断哪个声音事件持续时间最长
  • 数据构成

    • 共有 718 个独特的音频片段(audio),格式为解码的 mp3。
    • 正确答案选项(A/B/C/D)的分布在每个任务中保持近平衡。
    • 每个音频片段可能出现在多个任务中。
  • 数据字段

    • audio: 解码的音频数据。
    • filename: 源 mp3 文件名。
    • question: 题目提示语。
    • option_aoption_d: 四个候选答案文本。
    • correct_answer: 正确选项的字母(A/B/C/D)。
    • correct_text: 正确选项的文本内容。
    • task: 所属任务类型。
  • 许可证:知识共享 4.0 国际许可协议 (cc-by-4.0)。

  • 语言:英语(en)。

  • 相关资源

    • 项目主页:https://apoorva-ak.github.io/temporal-reasoning-lalms/
    • 研究论文:https://arxiv.org/pdf/2606.17417
    • 基础数据集 TACOS 论文:https://arxiv.org/abs/2505.07609
搜集汇总
数据集介绍
temporal-lalm 数据集图片
构建方式
Temporal LALM数据集基于TACOS音频语料库构建,旨在评估大型音频语言模型在时间推理方面的能力。该数据集通过从TACOS中精心挑选718段独特音频片段,针对每段音频设计了关于相对时间关系的多项选择问题,涵盖三种任务类型:最早开始、最晚结束和最长持续时长。每个问题提供四个选项,正确答案的字母分布在A、B、C、D之间保持均衡,共生成1657个多项选择问题,确保数据集的平衡性与挑战性。
特点
该数据集的核心特点在于聚焦音频中的相对时间推理,这是现有音频理解基准中较少涉及的认知维度。每个音频片段可对应多个任务,从而提供多角度的时间关系评估。数据集明确标注了任务类型、问题文本、选项内容及正确答案,并包含解码后的音频文件与原始文件名,便于研究者直接使用。此外,数据集的规模适中(1K-10K),兼顾了评估的全面性与计算效率,适合作为大型音频语言模型的细粒度测试工具。
使用方法
研究者可通过HuggingFace Datasets库便捷加载该数据集,示例代码为`load_dataset("gamma-lab-umd/temporal-lalm", split="train")`,直接获取训练集数据。每条数据包含音频、问题、四个选项及正确答案等字段,适用于音频分类与问答任务。建议结合该数据集的论文(arXiv:2606.17417)了解任务设计背景,并使用其提供的评价指标评估模型在相对时间推理上的表现。数据采用CC-BY-4.0许可,引用时需注明原始论文及TACOS语料库来源。
背景与挑战
背景概述
Temporal LALM(Relative Temporal MCQA)数据集由马里兰大学帕克分校等机构的研究人员于2026年提出,旨在系统性地评估大型音频-语言模型在时间理解方面的能力。该数据集聚焦于相对时间推理任务,要求模型从音频片段中识别出哪个声音事件开始最早、结束最晚或持续时间最长。基于TACOS音频集合构建,共包含718个独特音频片段和1657道多选题,覆盖三种时间推理子任务。该数据集填补了当前音频-语言模型评估中时间推理能力的空白,为相关领域的研究提供了标准化基准,对推动音频理解技术的发展具有重要意义。
当前挑战
该数据集所解决的领域问题在于,当前主流音频-语言模型在时间关系推理上存在显著短板,尤其在处理相对时间顺序和事件持续时间比较时表现不佳。构建过程中面临的挑战包括:如何从TACOS集合中精确提取具有明确时间边界的事件对,确保每个多选题的选项在时间维度上具有可区分性;如何平衡正确答案在四个选项中的分布以避免偏差;以及如何保证音频片段跨不同任务复用时不会引入冗余或混淆信息。这些环节都需要精细的时间标注和严格的质量控制,从而确保数据集的有效性和可靠性。
常用场景
经典使用场景
在音频理解领域,对时间关系的推理能力是衡量模型智能水平的重要标尺。Temporal LALM 数据集专为评估大型音频语言模型在相对时间推理任务上的表现而设计,其经典使用场景涵盖三种核心问题:识别音频片段中哪个声音事件开始得最早、结束得最晚或持续时间最长。通过多选问答的形式,该数据集要求模型在多个同时或顺序发生的事件中做出精确的时间判断,从而检验其对音频时间结构的深层理解。
衍生相关工作
Temporal LALM 的发布催生了一系列后续研究工作。该数据集直接服务于作者团队在论文中系统性分析大型音频语言模型时间理解失败模式的工作,揭示了模型在时间推理上的普遍短板。此外,构建于 TACOS 音频集合之上的特性,使得该数据集可与时间对齐的音频字幕数据相结合,激励了融合时序监督信号进行预训练的新方法探索,推动了音频语言模型从静态内容理解向动态时序推理的演进。
数据集最近研究
最新研究方向
该数据集聚焦于评估大型音频语言模型在相对时间推理任务中的表现,涉及对音频事件开始最早、结束最晚或持续时间最长的判断。这一研究方向紧扣当前多模态大模型在细粒度时序理解上的薄弱环节,旨在揭示现有模型在时间因果与顺序推理中的失败模式。通过构建基于TACOS音频集合的1725道四选一多选题,该数据集为音频时间推理设立了标准化评测基准,推动了听觉感知与语言理解交叉领域的深入探索。相关研究不仅服务于智能语音助手、自动驾驶感知等应用场景,更对理解模型在复杂音频事件中的认知机制具有关键意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务