遇见数据集

video-vec2wav2-tokenizer-2

收藏
Hugging Face2026-07-09 更新2026-07-10 收录
官方服务:

资源简介:

该数据集是由视频处理管道(video-vec2wav2-tokenizer-2)生成的,专为语音识别(ASR)和文本转语音(TTS)模型的AI训练而设计。它通过对输入视频(支持mp4、mkv、avi、mov、webm格式)进行自动处理构建,核心流程包括:使用FFmpeg提取并转换为16 kHz、单声道、16位PCM的WAV音频;利用faster-whisper模型(支持CPU和CUDA)进行自动语言检测和语音识别,生成带词级时间戳的转录文本;根据时间戳将音频切割成片段;最终生成结构化的数据集。数据集包含音频片段文件(.wav)、对应的转录文本、音频时长以及可选的说话人标识。输出格式多样,包括CSV、JSONL和JSON文件,用于不同用途:`metadata.csv`(音频文件与文本的映射)、`dataset.jsonl`(包含音频路径、文本和时长的结构化记录)、`tts_metadata.csv`(为TTS任务添加说话人信息)、`report.json`(包含总样本数、总/平均时长、语言分布等统计信息)。此外,还可选择生成流式特征文件(`features/train.bin`和`train.dat`),其中包含浮点音频样本和梅尔频谱图。数据集处理支持多进程、批处理,并能高效扩展到处理超过1TB的源视频数据。配置灵活,可指定Whisper模型、强制语言、处理设备(CPU/CUDA)、音频片段的最小/最大长度以及说话人分配模式(固定、按视频、按文件)。该数据集主要用于微调基于CTC的HuggingFace Wav2Vec2等语音处理模型。

This dataset is generated by a video processing pipeline (video-vec2wav2-tokenizer-2) and is specifically designed for AI training of automatic speech recognition (ASR) and text-to-speech (TTS) models. It is constructed through automated processing of input videos (supporting formats such as mp4, mkv, avi, mov, webm). The core workflow includes: using FFmpeg to extract and convert audio to WAV format with 16 kHz, mono, 16-bit PCM; utilizing the faster-whisper model (supporting both CPU and CUDA) for automatic language detection and speech recognition, generating transcription text with word-level timestamps; segmenting the audio based on timestamps; and finally producing a structured dataset. The dataset contains audio segment files (.wav), corresponding transcription texts, audio durations, and optional speaker identifiers. Output formats are diverse, including CSV, JSONL, and JSON files for various purposes: `metadata.csv` (mapping audio files to text), `dataset.jsonl` (structured records containing audio paths, text, and durations), `tts_metadata.csv` (adding speaker information for TTS tasks), `report.json` (statistical information including total sample count, total/average duration, language distribution, etc.). Additionally, optional streaming feature files (`features/train.bin` and `train.dat`) can be generated, containing floating-point audio samples and mel spectrograms. The dataset processing supports multi-processing, batch processing, and can efficiently scale to handle over 1TB of source video data. Configuration is flexible, allowing specification of Whisper models, forced language, processing devices (CPU/CUDA), minimum/maximum audio segment lengths, and speaker assignment modes (fixed, per video, per file). This dataset is primarily used for fine-tuning CTC-based HuggingFace Wav2Vec2 and other speech processing models.

创建时间:
2026-07-09
原始信息汇总

数据集概述

数据集名称

video-vec2wav2-tokenizer-2(Version 2)

核心功能

该数据集是一个从视频到AI训练数据集的流水线工具,专为自动语音识别和文本转语音任务设计。它将视频文件夹处理为清洁的、可直接用于模型训练的数据集。

处理流程

  1. 视频输入:递归扫描 mp4 / mkv / avi / mov / webm 格式的视频文件。
  2. 音频提取:使用FFmpeg将视频音频提取为单声道、16 kHz、16-bit PCM WAV格式。
  3. 语音识别:使用 faster-whisper 进行语音转文本,支持CPU和CUDA,自动语言检测,并提供词级时间戳。
  4. 音频分割:根据转录时间戳将音频切割成独立的音频片段,存储为 dataset/audio/000001.wav 等文件。
  5. 数据集生成:生成 metadata.csvdataset.jsonltts_metadata.csv 等标准格式的元数据文件。
  6. 特征提取:可选步骤,生成流式特征文件 features/train.binfeatures/train.dat,包含float32样本、梅尔频谱图、持续时间和采样率。
  7. 统计报告:生成 report.json,包含总数、总时长和语言分布。
  8. 模型训练:提供 train_wav2vec2.py 脚本,支持Wav2Vec2 CTC模型微调,具备断点续训、多GPU和混合精度训练功能。

输出格式

文件 格式
metadata.csv `000001.wav
dataset.jsonl {"audio":"audio/000001.wav","text":"Hello world","duration":2.5}
tts_metadata.csv `000001.wav
report.json 总量、总/平均时长、语言分布
features/train.bin 小端序float32:每个片段的音频样本+梅尔谱
features/train.dat JSONL索引(偏移量、形状、时长、采样率)

架构特点

  • 惰性导入faster-whispertorchtransformers 等大型依赖仅在执行相关命令时导入,核心库轻量快速。
  • 流式处理:转录、切片、特征存储均按视频逐一处理,内存使用与语料库大小无关。
  • 优雅降级:当 soundfile/librosa 未安装时,WAV IO和梅尔频谱图会回退到stdlib和NumPy。
  • 容错机制:处理失败的视频会被记录并跳过,流水线继续运行。

关键配置参数 (config.yaml)

  • model_name: facebook/wav2vec2-base-960h(训练模型)
  • whisper_model: large-v3(ASR模型)
  • language: null(自动检测)
  • device: auto(自动选择CPU/CUDA)
  • sample_rate: 16000channels: 1
  • min_segment_length / max_segment_length: 1.0 / 20.0(音频片段长度限制)
  • speaker_mode: fixed(固定说话人;可选按视频或按片段划分)

依赖与环境

  • 需要Python 3.11+ 和系统安装的FFmpeg。
  • 核心依赖较少,训练的额外依赖(torch, transformers)可选。
搜集汇总
数据集介绍
video-vec2wav2-tokenizer-2 数据集图片
构建方式
video-vec2wav2-tokenizer-2数据集构建了一个从原始视频到语音识别与文本转语音训练数据的端到端流水线。该流程首先利用FFmpeg对视频文件进行递归扫描与音频提取,将音频统一转换为16kHz单声道16-bit PCM WAV格式。随后借助faster-whisper模型进行自动语言检测与词级时间戳标注的语音识别,并依据时间戳将音频分割为独立片段。最终生成包含音频路径、文本转录及说话人标签的metadata.csv、dataset.jsonl与tts_metadata.csv等多格式数据集文件,同时可提取梅尔频谱图等特征并以流式方式存储为二进制文件。
特点
该数据集的核心特点在于其高度自动化与模块化设计,支持从视频到可用数据集的一键式处理。其采用惰性导入机制,仅在执行特定命令时加载faster-whisper、torch等重型依赖,确保了核心库的轻量与高效。流式处理架构使内存消耗与语料库规模无关,可轻松扩展至TB级源媒体。此外,系统具备容错能力,对失败的视频进行日志记录并跳过,保证流水线持续运行。输出格式丰富,涵盖CSV、JSONL及二进制特征文件,并附带详尽的统计报告。
使用方法
用户可通过命令行工具video2dataset快速运行完整流水线,例如执行'video2dataset process ./input/videos --extract-features'即可完成视频处理至特征提取的全流程。CLI提供子命令实现分步操作:process用于整体处理,transcribe仅进行语音识别,segment负责音频分割,features提取特征,train则进行Wav2Vec2 CTC模型的微调训练。用户可通过config.yaml配置文件或命令行全局标志灵活调整Whisper模型、设备类型、采样率等参数。对于多GPU训练,支持使用torchrun实现分布式训练。
背景与挑战
背景概述
video-vec2wav2-tokenizer-2数据集由研究团队于2023年后持续开发,旨在应对视频数据向高质量语音识别(ASR)与文本转语音(TTS)训练数据转化的核心需求。该数据集依托faster-whisper和Wav2Vec2等技术,构建了一套从视频输入到标准化音频片段及标注文件的全自动流水线。其核心研究问题聚焦于大规模视频语料的高效清洗与结构化,通过递归扫描、多格式支持、自动语音检测及语言识别,显著降低了传统人工标注成本。在语音领域,该数据集为跨语言ASR和TTS模型提供了可复现的基准数据,推动了弱监督学习与多模态对齐的研究,成为开源社区中视频到语音数据转换的关键基础设施。
当前挑战
该数据集面临的挑战包括:领域问题层面,如何从嘈杂、多语种、非结构化的视频中提取清晰且时间对齐的语音片段,以支撑高精度ASR模型训练。构建过程中,需处理海量视频(超1TB)的内存优化问题,通过流式处理和分片转录实现可扩展性;同时解决多格式容器(mp4/mkv/avi等)的音频抽取一致性、自动语言检测的准确率平衡,以及长视频中沉默或噪声段落的智能分割,避免无效数据污染训练集。此外,多说话人场景下的身份标识固定或自适应策略,以及跨设备(CPU/CUDA)的推理效率优化,亦是确保数据集通用性与实用性的核心挑战。
常用场景
经典使用场景
video-vec2wav2-tokenizer-2数据集为语音识别与合成领域提供了一条从原始视频到标准化AI训练数据的完整流水线。其典型应用场景包括从海量视频中高效提取对齐的音频-文本对,生成整洁的metadata.csv、dataset.jsonl和tts_metadata.csv格式文件,直接服务于自动语音识别与文本转语音模型的监督学习。
衍生相关工作
该工作衍生了多个有价值的后续研究与实践方向。其内置的Wav2Vec2 CTC训练脚本支持多GPU混合精度训练与断点续训,推动了轻量化语音模型在边缘设备上的部署探索。此外,其 streaming特征存储方案与容错机制为构建超大规模、持续更新的语音-文本语料库系统提供了参考架构。
数据集最近研究
最新研究方向
video-vec2wav2-tokenizer-2作为新一代视频到AI数据集流水线工具,正引领多模态语音处理领域的范式革新。该数据集聚焦于将非结构化视频原始素材高效转化为高质量语音识别与文本转语音训练数据,其核心技术栈融合了Whisper大模型语音转录、基于时间戳的精准音频分割以及流式特征提取机制。在自监督学习浪潮迭起的当下,该数据集为Wav2Vec2等预训练模型的微调提供了端到端的解决方案,支持多GPU并行训练与混合精度计算,显著降低了从视频数据构建专业语音数据集的工程门槛。其设计理念强调内存效率与故障容错,能够处理超过1TB的源媒体,为大规模多语言语料库的构建开辟了新路径,对推动低资源语音技术的普惠发展具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务