遇见数据集

ai-sage/TimeGround-1M

收藏
Hugging Face2026-07-14 更新2026-07-22 收录
官方服务:

资源简介:

TimeGround-1M是一个合成英语音频数据集,专为时间感知语音理解设计,涵盖时间定位、时间描述和定时摘要任务。数据来源于YODAS2英语片段,从24k小时的源池中经过语言和静音比例过滤后,选择了14k小时的音频。通过基于LLM的验证、确定性有效性检查和分层采样,为三个时间相关任务生成了合成注释。最终数据按音频时长分组,包括0-10分钟、10-20分钟、20-60分钟和60-120分钟等桶。数据集提供多个配置:tl用于时间定位(输入事件描述,输出时间间隔),td用于时间描述(输入时间间隔,输出描述),sum用于定时摘要(输入完整音频,输出带时间戳的分段摘要),以及recordings用于包含嵌套注释的长形式录音。数据集支持流式加载,音频文件以WAV格式存储,可通过HuggingFace数据集库使用。

TimeGround-1M is a synthetic English audio dataset tailored for time-aware speech understanding, encompassing three core tasks: temporal localization, temporal description, and timed summarization. The dataset is sourced from YODAS2 English segments, where 14k hours of audio were selected from a 24k-hour source pool after filtering based on language and silence ratio criteria. Synthetic annotations for the three time-related tasks were generated via LLM-based validation, deterministic validity checks, and stratified sampling. The finalized dataset is grouped by audio duration into buckets including 0–10 minutes, 10–20 minutes, 20–60 minutes, and 60–120 minutes. The dataset offers multiple configurations: `tl` for temporal localization (input: event description, output: time interval), `td` for temporal description (input: time interval, output: description), `sum` for timed summarization (input: full audio, output: timestamped segmented summary), and `recordings` for long-form recordings with nested annotations. Audio files are stored in WAV format, and the dataset supports streaming loading, which can be accessed via the Hugging Face Datasets library.

提供机构:
ai-sage
搜集汇总
数据集介绍
ai-sage/TimeGround-1M 数据集图片
构建方式
TimeGround-1M是一个专为时间感知语音理解设计的合成英文音频数据集,其构建过程严格而精细。数据源选取自YODAS2英语分片,经过语言与静音比例过滤后,从约24k小时原始音频中筛选出14k小时高质量音频。在此基础上,针对时间定位、时间描述和带时间戳的摘要三项任务生成合成标注,并通过大语言模型验证、确定性有效性检查及分层采样等多重过滤机制,最终形成了涵盖不同时长桶的约63k条音频记录,其中训练集与测试集分别包含约59k和4.2k条独立音频,总时长超过14k小时。
特点
该数据集最显著的特征在于其时间敏感性与多任务覆盖能力。它同时支持时间定位(TL)、时间描述(TD)和带时间戳的摘要(SUM)三类任务,为模型提供了从短片段到长达两小时的长语音理解能力。数据集按音频时长分为0-10分钟、10-20分钟、20-60分钟和60-120分钟四个桶,确保各长度段均有充足样本。此外,数据集中还包含recordings配置,将同一长音频对应的所有任务标注嵌套存储,便于研究任务间的关联性。数据格式采用高效的Parquet文件,并支持流式加载以适应大规模处理需求。
使用方法
研究者可通过HuggingFace Datasets库轻松使用该数据集。推荐使用datasets==3.6.0版本,通过load_dataset函数加载指定任务配置(如'tl'、'td'或'sum'),并启用streaming=True实现流式读取,避免内存溢出。每个样本包含音频路径、问题与答案字段,其中音频以路径形式存储,可选择性解码或仅获取元数据。对于需要完整长音频的研究,可使用'recordings'配置获取嵌套结构的数据。典型使用流程包括加载数据集、迭代样本、解码音频数组与采样率,最终用于训练或评估时间感知的语音模型。
背景与挑战
背景概述
随着大规模语言模型与语音模态的深度融合,对语音内容进行精确的时间感知理解成为多模态人工智能领域的前沿课题。在这一背景下,TimeGround-1M数据集由俄罗斯研究团队于2026年创建,相关成果发表于Interspeech 2026,核心机构包括ai-sage与多位语音与自然语言处理领域的学者。该数据集聚焦于长时间语音中的时间定位、时间描述与带时间戳的摘要三项关键任务,旨在弥补现有数据集在时间感知语音理解方面的空白。通过从YODAS2语料库中筛选约1.4万小时英语音频,并配合合成标注与多层次质量过滤,TimeGround-1M为大模型提供了高质量的时序监督信号。其基础模型GigaChat Audio 10B在时间定位任务上超越多个主流多模态基线,显著推动了语音理解的时间维度研究。
当前挑战
TimeGround-1M所应对的领域核心挑战在于,现有语音理解模型普遍缺乏精确的时间感知能力,长时间音频中的事件定位与结构化摘要任务长期未获充分关注。该数据集在构建过程中面临多重困难:一方面,需从24k小时源数据中高效筛选语言纯净、静音比例合理的音频片段,以保证任务数据的可用性;另一方面,合成标注的生成需依赖大语言模型进行验证,而不同时长区间(0至120分钟)的数据分布差异极大,需通过细致的时长分桶与分层采样才能确保各子任务的数据平衡与代表性。此外,带时间戳摘要任务还需牺牲部分训练样本以满足BLEU过滤标准,进一步抬高了数据构建的工程复杂度。
常用场景
经典使用场景
TimeGround-1M作为面向时间感知语音理解的大规模合成英文音频数据集,其最经典的使用场景在于为长时长语音的时序定位任务提供训练与评测基础。该数据集支持三类核心任务:时序定位(Temporal Localization),即根据事件描述或问题检索其在音频中发生的精确时间区间;时序描述(Temporal Description),即对给定时间区间内的语音内容进行语义描述;以及带时间戳的分段摘要(Timed Summaries),即对完整音频生成带起始时间戳的分段摘要。这些任务共同奠定了时序语音理解领域从精准检索到语义概括的全链条研究范式。
衍生相关工作
围绕TimeGround-1M,已衍生出一系列开创性工作。最直接的代表是依托该数据集训练的GigaChat Audio 10B(A1.8B)时间感知音频大语言模型,该模型在时序定位任务上实现了显著领先的性能,在≤10分钟和20-60分钟音频片段的mIoU指标上分别达40.3和48.3,远超同期开源模型。此外,该数据集还为相关的语音大模型研究提供了标准化的时序理解评测基准,推动了如Voxtral、Phi-4和Qwen3-Omni等模型在时序感知能力上的对比与改进。这些工作共同验证了大规模时序标注数据对提升语音模型时间推理能力的核心作用,并为未来多模态时序理解研究奠定了坚实基础。
数据集最近研究
最新研究方向
TimeGround-1M数据集聚焦于时间感知的语音理解前沿方向,特别针对长音频的时间定位、时间描述与带时间戳摘要任务。该数据集包含约6.3万条长语音录音,经语言与静音比筛选及LLM验证生成高质量合成标注,覆盖从分钟到两小时的音频时长区间。当前研究热点集中在其支撑的GigaChat Audio 10B模型上,该模型在时间定位任务中表现卓越,如20-60分钟音频的mIoU达48.3,显著超越Voxtral与Qwen3-Omni等对比模型,并在时间描述与摘要任务中保持领先。这一工作为多模态大语言模型在长音频场景下的细粒度时间理解提供了关键基准与训练资源,推动了语音问答、会议分析等领域的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务