遇见数据集

video-vec2wav2-tokenizer-3

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

该数据集是由video-vec2wav2-tokenizer-3处理管道生成的AI训练数据集,专门用于语音识别(ASR)和文本转语音(TTS)任务。数据来源于输入视频文件夹,通过管道转换为标准化格式。核心数据包括从视频中提取的音频片段及其对应的转录文本,音频被处理为16kHz、单声道、16位PCM格式的WAV文件,并根据语音识别的词级时间戳进行切割,生成独立的剪辑文件。数据集以多种格式输出,包括metadata.csv(音频文件名与转录文本的映射)、dataset.jsonl(每行包含音频路径、文本和时长等信息的JSON对象)、tts_metadata.csv(为TTS任务设计的元数据,包含说话人ID)、report.json(统计信息如总剪辑数、时长分布等)以及可选的特征文件(如存储音频样本和梅尔频谱图的二进制文件)。处理流程涵盖视频扫描、音频提取、语音识别(支持自动语言检测)、分割和数据集构建,支持流式处理和容错,可高效处理大规模源媒体数据,并允许通过配置参数(如最小和最大片段长度)调整音频片段长度。

This dataset is an AI training dataset generated by the video-vec2wav2-tokenizer-3 processing pipeline, specifically designed for speech recognition (ASR) and text-to-speech (TTS) tasks. The data originates from input video folders and is transformed into a standardized format via the pipeline. Core data consists of audio segments extracted from videos along with corresponding transcriptions. The audio is processed into WAV files with 16kHz, mono, 16-bit PCM format, and segmented into individual clip files based on word-level timestamps from speech recognition. The dataset is output in multiple complementary formats, including metadata.csv (a simple mapping of audio filenames to transcriptions), dataset.jsonl (each line as a JSON object containing audio file path, text, duration, etc.), tts_metadata.csv (metadata for TTS tasks with speaker IDs), report.json (statistical information such as total clips, average duration, language distribution), and optional feature files (e.g., storing raw float32 audio samples and mel-spectrograms). The processing pipeline involves video scanning, audio extraction, speech recognition (with automatic language detection), timestamp-based segmentation, and dataset construction. It supports streaming processing and fault tolerance, enabling efficient handling of large-scale (terabyte-level) source media data, and allows configuration of audio segment lengths via parameters like min_segment_length and max_segment_length.

创建时间:
2026-07-18
原始信息汇总

数据集概述

数据集名称:video-vec2wav2-tokenizer-3
版本:Version 3(延续视频到AI数据集分词器项目)
用途:将视频文件夹转换为干净的AI训练数据集,用于语音识别(ASR)和文本转语音(TTS)。


数据处理流程

  1. 视频处理:递归扫描mp4 / mkv / avi / mov / webm格式视频,通过FFmpeg提取音频为单声道16 kHz 16-bit PCM WAV格式。
  2. 语音识别:使用faster-whisper进行自动语言检测和词级时间戳生成,支持CPU和CUDA。
  3. 分割:根据转录时间戳切割音频为独立片段(如dataset/audio/000001.wav)。
  4. 数据集生成:生成metadata.csvdataset.jsonltts_metadata.csv等文件。
  5. 特征提取(可选):流式生成features/train.bin + train.dat,包含float32样本、梅尔频谱图、时长和采样率。
  6. 统计:生成report.json,包含总数、时长和语言分布。
  7. 训练train_wav2vec2.py支持HuggingFace Wav2Vec2 CTC训练,可恢复训练、多GPU、混合精度和检查点保存。
  8. 性能优化:多进程、批处理、tqdm进度条,支持超过1 TB源媒体的内存高效流式处理。

输出格式

文件 格式示例
metadata.csv `000001.wav
dataset.jsonl {"audio":"audio/000001.wav","text":"Hello world","duration":2.5}
tts_metadata.csv `000001.wav
report.json 总数、总/平均时长、语言分布
features/train.bin 小端float32平面数据:音频样本 + 梅尔频谱图
features/train.dat JSONL索引(偏移、形状、时长、采样率)

配置参数(config.yaml)

  • model_name: facebook/wav2vec2-base-960h(训练模型)
  • whisper_model: large-v3(ASR模型)
  • language: null(自动检测)
  • device: auto(可选cpucuda
  • sample_rate: 16000
  • channels: 1
  • min_segment_length: 1.0
  • max_segment_length: 20.0
  • default_speaker: speaker_001
  • speaker_mode: fixed(可选per_videoper_file
  • output_dir: dataset
  • features_dir: features
  • num_workers: 4
  • batch_size: 16

架构与设计特点

  • 延迟导入:faster-whisper、torch和transformers仅在对应命令运行时导入,核心库和测试保持轻量。
  • 流式处理:转录使用whisper生成器;片段和清单行按源视频生成;特征存储逐片段追加。
  • 优雅降级:未安装soundfile/librosa时,WAV IO和梅尔频谱图回退至stdlib+NumPy。
  • 容错机制:失败视频记录日志并跳过,整体运行继续。

许可证

MIT

搜集汇总
数据集介绍
video-vec2wav2-tokenizer-3 数据集图片
构建方式
video-vec2wav2-tokenizer-3数据集通过一套端到端的自动化流水线构建而成。该流水线首先对输入文件夹中的视频文件(支持mp4、mkv、avi、mov、webm等格式)进行递归扫描,并利用FFmpeg工具将音频流提取为16kHz单声道、16-bit精度的PCM WAV格式。随后,借助faster-whisper模型对音频进行自动语音识别,生成包含词级时间戳的转录文本。基于转录结果,系统依据时间戳对音频进行精准切分,形成独立的音频片段,并生成包含音频路径、转录文本、时长及说话人信息的元数据文件(如metadata.csv、dataset.jsonl、tts_metadata.csv)。此外,流水线还可选地进行特征提取,将音频样本和梅尔频谱图以流式方式存储为二进制文件,为后续模型训练提供高效的数据访问。
特点
该数据集具有多项显著特点。首先,其构建流程高度自动化,从原始视频到可训练的语音数据集仅需一条命令即可完成,极大降低了数据准备的门槛。其次,流水线在处理大规模数据时展现出卓越的性能,通过多进程处理、批处理以及内存高效的流式传输机制,能够轻松应对超过1TB的源媒体文件。此外,系统具备良好的容错性,单个视频的处理失败不会影响整体运行,仅会被记录并跳过。输出格式多样,同时支持ASR(自动语音识别)和TTS(文本转语音)两种任务场景,并提供了灵活的说话人模式设置。值得一提的是,核心依赖库如faster-whisper和PyTorch采用懒加载策略,使得基础库和测试保持轻量快速。
使用方法
使用该数据集需首先确保Python 3.11+环境及FFmpeg工具已正确安装。用户可通过pip安装包含所有依赖的Python包,并利用暴露的CLI命令`video2dataset`进行操作。入门示例中,只需将所有视频放入input/videos目录,运行`video2dataset process ./input/videos --extract-features`,系统便会自动执行全流程,最终在dataset/目录下生成切分后的音频文件、各类元数据及统计报告。此外,用户还可通过子命令分别执行转录、切分、特征提取和模型训练等步骤,并可通过配置文件config.yaml或命令行全局参数灵活定制Whisper模型、设备选择、语言、音频片段长度及说话人模式等配置,以满足不同场景下的具体需求。对于多GPU训练,则支持使用torchrun进行分布式训练。
背景与挑战
背景概述
Video-Vec2Wav2-Tokenizer-3数据集诞生于人工智能语音技术迅猛发展的时代背景下,由致力于开源语音处理工具链的研究团队持续迭代构建,旨在弥合视频内容与高质量语音训练数据之间的鸿沟。该数据集的核心研究问题聚焦于如何将海量非结构化视频资源高效转化为可用于自动语音识别(ASR)和文本转语音(TTS)任务的标准化数据集。作为该项目的第三个版本,它延续了前序版本的技术路线,通过集成视频处理、语音识别(基于faster-whisper)、音频分割及特征提取等模块,构建了一套端到端的生产级数据流水线。该数据集的发布,为语音领域的研究者与开发者提供了一种低成本、高效率的数据制备方案,尤其在缺乏大规模标注语料的场景下,显著提升了从视频素材中挖掘语音数据的可行性与质量,对推动语音识别与合成技术的落地应用具有重要价值。
当前挑战
该数据集所解决的领域问题主要涉及视频内容中语音数据的自动化提取与结构化。传统上,从视频中构建ASR/TTS训练数据需依赖繁琐的手工标注与格式转换,效率低下且成本高昂。Video-Vec2Wav2-Tokenizer-3通过流水线方式实现从视频到标准化数据集的端到端处理,有效应对了语音数据稀缺及制备门槛高的挑战。在构建过程中,该数据集面临多重技术挑战:一是多模态视频格式的兼容性问题,需递归处理mp4、mkv、avi等多种容器格式,并确保音频提取的稳定性与一致性;二是语音识别精确性与多语言支持的平衡,需在CPU与CUDA环境下高效运行faster-whisper模型,并处理自动语言检测与词级时间戳对齐;三是大规模数据处理的资源优化,需在流式处理架构下实现内存独立于语料库大小的扩展,以支撑超过1TB源媒体的高效处理,同时保证异常视频的容错与流程的连续性。
常用场景
经典使用场景
在语音与视频多模态研究领域,video-vec2wav2-tokenizer-3数据集以其贯穿视频到音频、再到文本对齐标注的完整处理管线,成为构建高质量语音识别与合成训练数据集的经典基石。研究者常将原始视频素材投入该管线的自动化流程,获得经过精准时间戳分割的16kHz单声道音频片段及其对应的Whisper转录文本,进而直接用于训练诸如Wav2Vec2等自监督语音模型,或作为端到端文本转语音系统的声学与语言配对数据。其标准化的输出格式——包括metadata.csv、dataset.jsonl与tts_metadata.csv——显著降低了从非结构化视频中构建可复用学术数据集的工程门槛。
衍生相关工作
基于该数据集生成范式,学术界衍生出了一系列经典工作。在自监督语音表征学习方面,以大规模视频转录数据微调Wav2Vec2 CTC模型的工作屡见不鲜,推动了低资源语言识别准确率的显著提升。在多模态学习领域,研究者利用其输出的音视频时间对齐特性,发展了视频内容理解中的视听关联建模方法,例如通过语音片段与视觉场景的共生关系学习跨模态嵌入。此外,其tts_metadata.csv格式启发了多说话人语音合成中的说话人嵌入抽取研究,相关工作常采用其中的speaker标签作为条件变分自编码器的控制信号。管线的模块化设计亦催生了针对特定领域(如医疗会议、法庭记录)的专用tokenizer改进版本。
数据集最近研究
最新研究方向
video-vec2wav2-tokenizer-3数据集聚焦于视频到语音智能标注与清洗的前沿方向,通过集成Whisper大模型实现多语种自动语音识别与精准时间戳切割,为大规模自监督学习(如Wav2Vec2微调)提供高质量对位语料。其流式处理架构可轻松扩展到TB级视频源,有效解决传统ASR/TTS数据集构建中数据噪声高、标注成本大的痛点。结合多GPU混合精度训练与故障容错机制,该工具链正成为推动开放语音技术落地、降低高质量语音数据获取门槛的关键基础设施,特别是在多方言、低资源语言及语音克隆等热点应用中展现了深远价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务