遇见数据集

ivirits-audio-v2-30s

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

ivrit.ai audio-v2 数据集是一个面向希伯来语自动语音识别(ASR)微调的大规模语音数据集,包含超过 20,000 小时的希伯来语音频,经过 VAD(语音活动检测)切割为 2–30 秒的语音片段,并使用 Whisper 模型(ivrit-ai/whisper-large-v3-turbo)生成机器转录文本。数据来源于 ivrit-ai/audio-v2 原始数据,通过 Silero VAD 进行语音检测,对于超过 30 秒的语音区域在静默处分割,短于 2 秒的片段被丢弃。所有音频被重采样为 16 kHz 单声道 FLAC 格式,并嵌入在 Parquet 分片中。数据集包含以下字段:segment_id(稳定标识符)、episode/source(原始音频路径和来源)、audio(FLAC 音频)、text(Whisper 转录文本)、start_sec/end_sec/duration_sec(在源音频中的偏移)、mean_token_logprob/token_confidence(解码器置信度,可用于过滤)、vad_confidence_*/vad_speech_ratio(Silero 语音概率)。由于转录由机器生成且未经人工验证,建议在训练前根据 token_confidence 和 vad_speech_ratio 进行过滤。该数据集继承了 ivrit.ai 许可证。

The ivrit.ai audio-v2 dataset is a large-scale speech dataset for fine-tuning Hebrew automatic speech recognition (ASR), containing over 20,000 hours of Hebrew audio. It is segmented into 2–30 second speech clips using VAD (Voice Activity Detection) and transcribed by the Whisper model (ivrit-ai/whisper-large-v3-turbo). The data originates from ivrit-ai/audio-v2 raw data, with speech detection performed by Silero VAD. Speech regions longer than 30 seconds are segmented at silence points, and clips shorter than 2 seconds are discarded. All audio is resampled to 16 kHz mono FLAC format and embedded in Parquet shards. The dataset includes the following fields: segment_id (stable identifier), episode/source (original audio path and source), audio (FLAC audio), text (Whisper transcription), start_sec/end_sec/duration_sec (offset in the source audio), mean_token_logprob/token_confidence (decoder confidence, useful for filtering), vad_confidence_*/vad_speech_ratio (Silero speech probability). Since the transcription is machine-generated and not human-verified, it is recommended to filter based on token_confidence and vad_speech_ratio before training. The dataset inherits the ivrit.ai license.

创建时间:
2026-08-11
原始信息汇总

数据集概述:ivirits-audio-v2-30s

基本信息

  • 数据集名称:ivrit.ai audio-v2 — 2–30 s segments
  • 语言:希伯来语(he)
  • 任务类别:自动语音识别(ASR)
  • 许可证:其他(继承自 ivrit.ai 许可证,详情见 ivrit.ai 许可证页面
  • 数据规模:1M < n < 10M 条记录

数据集内容

该数据集源自 ivrit-ai/audio-v2(包含超过 2 万小时的希伯来语音频),将其切分为 2–30 秒的语音片段,并附有机翻文本,可直接用于 ASR 模型微调。

构建流程

  1. 语音活动检测(VAD):使用 Silero VAD(ONNX)对每个解码为 16 kHz 单声道的剧集进行处理。超过 30 秒的语音区域会在窗口内最安静的足够长停顿处进行切分,确保切割点位于静音处而非词中;短于 2 秒的区域被丢弃。
  2. 转写:使用 ivrit-ai/whisper-large-v3-turbo 模型,通过 vLLM 服务,采用贪婪解码,语言设置为希伯来语(language=he)。
  3. 打包:将 FLAC 格式的 16 kHz 单声道音频嵌入 parquet 分片文件中。

数据规模统计

项目 数值
语音片段数 约 650 万(~6.5M)
parquet 分片数 2,343
总大小 1.38 TB
源剧集数 34,879 / 34,879(100%)
片段长度 2–30 秒(硬性边界)

数据列说明

列名 含义
segment_id 稳定 ID,格式为 {剧集名}_{六位序号}
episode / source 源剧集路径及 audio-v2 中的顶级来源
audio FLAC 格式,16 kHz 单声道音频
text Whisper 模型生成的转写文本
start_sec / end_sec / duration_sec 在源剧集中的时间偏移
mean_token_logprob / token_confidence 解码器置信度,可用于过滤低质量片段
vad_confidence_* / vad_speech_ratio Silero 语音概率,反映片段的语音占比

重要说明

  • 转写文本为机器生成且未经人工验证。建议在训练前基于 token_confidencecompression_ratiovad_speech_ratio 进行过滤——低 token_confidence 配合高 compression_ratio 通常是 Whisper 循环(loop)现象的典型特征。
  • 不包含词级时间戳:转写通过 vLLM 解码生成,该工具不产生词级时间对齐所需的交叉注意力对齐信息。token_logprobs 提供的是逐 token 的置信度。

许可证

本数据集继承了源数据集 ivrit.ai audio-v2ivrit.ai 许可证

搜集汇总
数据集介绍
ivirits-audio-v2-30s 数据集图片
构建方式
本数据集源自ivrit.ai audio-v2,这是一个包含超过2万小时希伯来语音频的大型语料库。构建流程首先利用Silero VAD(ONNX)对每个音频片段进行语音活动检测,将其解码为16kHz单声道,并仅保留时长在2至30秒之间的语音段。对于超过30秒的语音区域,系统会在最安静且足够长的暂停点进行切割,确保切分点落在静音处而非词汇中间。随后,通过ivrit-ai/whisper-large-v3-turbo模型(使用vLLM服务,贪婪解码,语言设定为希伯来语)生成机器转录文本。最终,将音频以FLAC格式(16kHz单声道)嵌入parquet分片文件中,共产生约650万个语音段,总大小1.38TB,涵盖全部34,879个源音频。
使用方法
该数据集专为希伯来语自动语音识别(ASR)微调设计,可直接用于训练端到端模型。用户可根据token_confidence、compression_ratio和vad_speech_ratio等列进行质量过滤,以剔除可能的错误转录(如Whisper循环)。由于未包含词级时间戳,建议使用表征学习或帧级模型。数据集以parquet格式存储,可通过HuggingFace datasets库加载,并支持分布式训练流水线。此外,数据列中的元数据(如start_sec和duration_sec)允许用户进行时间对齐或数据增强操作。
背景与挑战
背景概述
该数据集由ivrit.ai团队于近期创建,旨在为希伯来语自动语音识别(ASR)研究提供大规模、细粒度的训练资源。其基础来源于超过2万小时的希伯来语音频,通过Silero VAD进行语音活动检测,切分为2至30秒的语音段,并利用基于Whisper的模型生成机器转录文本。数据集包含约650万条语音段,总计1.38TB的音频数据,覆盖全部34,879个源片段,具备高覆盖率和实用性。该数据集的出现填补了希伯来语ASR领域缺乏大规模开源数据集的空白,对低资源语言的语音识别研究具有重要推动作用,并为模型微调、鲁棒性评估等下游任务提供了坚实的数据基础。
当前挑战
该数据集面临的核心挑战在于其转录文本完全由机器生成且未经人工验证,因此存在转录错误风险,尤其是在语音清晰度低、背景噪声大或口音特殊的场景中,可能引入系统性偏差。构建过程中,VAD切分需在静音处精确断句以避免切断词语,同时需平衡片段时长范围(2-30秒)以保留足够语义上下文,这要求算法在长语音段落中寻找最佳分割点。此外,由于vLLM解码不产生词级时间戳,数据集缺乏单词对齐信息,限制了其在细粒度语音理解任务中的应用。数据规模庞大(1.38TB),对存储和计算资源提出了较高要求。后续研究需依赖置信度指标(如token_confidence)进行数据筛选,以保证训练质量。
常用场景
经典使用场景
该数据集为希伯来语自动语音识别(ASR)领域提供了大规模、分段精细的音频-文本对资源。其核心价值在于,通过将超过2万小时的原始音频精准切分为2至30秒的语音片段,并辅以机器生成的转写文本,为研究者提供了可直接用于端到端ASR模型微调的高质量训练语料。常见应用包括基于Whisper、Conformer或Transformer架构的希伯来语语音识别模型训练,以及语音活动检测(VAD)与ASR联合优化的研究场景。
解决学术问题
该数据集有效解决了希伯来语等低资源语言在ASR研究中面临的数据稀缺问题。它提供了超过650万条标注语音片段,覆盖了丰富的口语场景,使得研究者能够深入探究模型在长尾词汇、方言变体及噪声环境下的鲁棒性。同时,数据集中提供的置信度指标(如token_confidence、vad_speech_ratio)为无监督或弱监督学习中的噪声标签过滤提供了量化依据,推动了鲁棒ASR系统构建和半监督学习范式的学术进展。
实际应用
在实际应用中,该数据集直接支持希伯来语语音助手的开发,如智能家居控制、语音搜索和实时字幕生成。其2-30秒的片段设计契合多数交互场景,可高效用于移动端和嵌入式设备的轻量化ASR模型训练。此外,标注的VAD分段信息可复用至语音端点检测、说话人日志等前置模块,加速从语音到文本的完整产品链路落地,为教育、媒体和客服行业的希伯来语语音服务提供了关键数据支撑。
数据集最近研究
最新研究方向
该数据集聚焦于希伯来语自动语音识别领域的前沿研究,通过Silero VAD分割和Whisper大型模型转录,构建了超过2万小时的精细语音片段库,为低资源语言的ASR微调提供了规模化、高质量的训练资源。其独特的两阶段处理流程有效避免了词间切割误差,并通过置信度指标辅助数据筛选,推动了语音识别在真实播客场景中的鲁棒性研究。该成果不仅加速了希伯来语语音技术的落地,也为多语言ASR系统的跨语种迁移与模型泛化能力探索提供了重要数据支撑,在语音技术应用于语言保护与文化传承方面具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务