遇见数据集

oil_and_gas_speech

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

俄语石油和天然气语音数据集是一个专门用于微调俄语自动语音识别模型的专业领域数据集。该数据集旨在帮助模型更好地识别和理解石油和天然气行业的专业术语及特定语境下的语音表达。数据集包含600个音频片段及其对应的文本转录,每个样本都按照上下文类型进行了分类标注,包括:行业术语、连接词和引导结构、疑问句表达,以及噪音、感叹词和难以辨别的语音。数据按80/10/10的比例划分为训练集(480个样本)、验证集(60个样本)和测试集(60个样本)。每个样本包含音频文件路径、文本转录、带时间戳的转录、Whisper模型识别的平均对数概率(置信度指标)、上下文类型标签、原始索引和人工验证标志等字段。数据准备过程中,从1000多个原始音频中筛选出模型置信度最高的600个样本,并保持了特定的类型分布比例。所有验证集和测试集样本以及训练集中置信度最低的20%样本都经过了人工验证,确保数据质量。音频采样率为16kHz,总数据集大小约52.5MB。该数据集适用于石油和天然气领域的专业语音识别任务,能够帮助模型适应行业特定的术语和沟通模式。

The Russian Oil and Gas Speech Dataset is a specialized domain dataset designed for fine-tuning Russian automatic speech recognition models. It aims to help models better recognize and understand professional terminology and speech expressions in specific contexts within the oil and gas industry. The dataset includes 600 audio clips with corresponding text transcriptions, each annotated by context type, covering: industry terminology, connectors and guiding structures, interrogative expressions, as well as noise, interjections, and hard-to-distinguish speech. The data is split into an 80/10/10 ratio for training set (480 samples), validation set (60 samples), and test set (60 samples). Each sample contains fields such as audio file path, text transcription, timestamped transcription, average log probability (confidence metric) recognized by the Whisper model, context type label, original index, and manual verification flag. During data preparation, the 600 samples with the highest model confidence were selected from over 1,000 original audio clips, maintaining specific type distribution proportions. All validation and test set samples, along with the 20% of training samples with the lowest confidence, have been manually verified to ensure data quality. The audio sampling rate is 16kHz, and the total dataset size is approximately 52.5MB. This dataset is suitable for professional speech recognition tasks in the oil and gas field, helping models adapt to industry-specific terminology and communication patterns.

创建时间:
2026-07-15
原始信息汇总

数据集概述:Нефтегазовый речевой датасет (Oil & Gas Russian Speech Dataset)

  • 语言:俄语 (ru)
  • 任务类别:自动语音识别 (automatic-speech-recognition)
  • 数据集规模:n<1K
  • 许可证:cc-by-nc-4.0
  • 数据集名称(英文):Oil & Gas Russian Speech Dataset

数据集描述

该数据集专为在石油天然气行业术语上对俄语语音识别神经网络模型进行微调而设计。包含 600 个音频片段及其转录文本,并按上下文类型分类:

  • term:行业词汇
  • connector:连接词和引入结构
  • question:疑问句
  • noise:噪音、感叹词、不清语音

数据划分

数据按 80/10/10 的比例划分为训练集 (train)、验证集 (validation) 和测试集 (test):

  • 训练集:480 个音频文件 (~42.1 MB)
  • 验证集:60 个音频文件 (~5.2 MB)
  • 测试集:60 个音频文件 (~5.3 MB)

质量控制:手动检查了验证集和测试集中的所有样本,以及训练集中模型置信度最低的 20% 样本(基于 avg_prob 字段)。

数据集结构

my_dataset/ ├── dataset_info.json ├── README.md ├── train/ │ ├── audio/ # 480 个音频文件 (~41.6 MB) │ └── metadata.jsonl ├── validation/ │ ├── audio/ # 60 个音频文件 (~5.2 MB) │ └── metadata.jsonl └── test/ ├── audio/ # 60 个音频文件 (~5.6 MB) └── metadata.jsonl

每个 metadata.jsonl 文件包含以下字段:

字段 类型 描述
audio string 音频文件的相对路径(例如 "train/audio/train_0.mp3")。
text string 音频的转录文本。
text_ts string 带时间戳的转录文本。
avg_prob float Whisper 模型识别的平均对数概率(值从 -∞ 到 0,0 表示完全确信)。
type string 上下文类型:"term""connector""question""noise"
index int 划分前在原始语料库中的索引。
human_verified bool 标识 text 字段是否经过人工审核。

创建目的

用于对自动语音识别 (ASR) 模型进行微调,使其适应石油天然气行业的专业术语和沟通特点。按上下文类型分类有助于评估模型在不同语音场景下的鲁棒性。

准备过程

  1. 使用 Whisper 模型(whisper.cpp)从超过 1000 个原始音频片段中获得转录文本和 avg_prob 值。
  2. 选出 600 个置信度最高的片段,并保持类型比例:term (50%), connector (30%), question (15%), noise (5%)。
  3. 进行分层抽样划分(train/val/test),确保每份数据都保持原始类型分布。
  4. 进行人工验证:所有验证集和测试集样本,以及训练集中 avg_prob 值最低的 20% 样本。

下载与使用

数据集可通过 Hugging Face 的 datasets 库加载:

python from datasets import load_dataset, Audio

dataset = load_dataset("N07P/oil_and_gas_speech", split="train") dataset = dataset.cast_column("audio", Audio(sampling_rate=16000)) print(dataset[0])

数据集大小

  • 下载大小(音频文件):46,392,372 字节 (~46.6 MB)
  • 数据集大小(元数据):1,063,945 字节 (~1.01 MB)

作者

  • 普罗沃托罗夫 N. R. (provotorovnikita@gmail.com, @prog_by_onion, https://vk.com/progbyonion)

补充信息

  • 额外链接:数据准备脚本可在 https://github.com/nikita-2727/ai_learning_workspace 获取。
  • 处理工具:使用 whisper.cpp 进行初始处理,所有转录文本都经过后处理以去除多余标签。
搜集汇总
数据集介绍
oil_and_gas_speech 数据集图片
构建方式
该数据集源于对石油天然气领域俄语语音的深度挖掘,从超过1000个原始音频片段中,借助Whisper模型(whisper.cpp)进行自动转录并计算平均对数概率(avg_prob)作为置信度指标。随后,精选600个置信度最高的片段,确保涵盖术语(50%)、连接词(30%)、疑问句(15%)与噪音(5%)四类语境,并采用分层抽样策略按80/10/10比例划分为训练集、验证集与测试集,以维持类别分布的一致性。最终,对验证集与测试集的所有样本,以及训练集中置信度最低的20%样本实施人工核验,保障转录文本的准确性。
特点
该数据集以精细化的语境分类为核心特色,通过术语、连接词、疑问句与噪音四种类别,精准模拟石油天然气行业中的真实通信场景,有助于评估语音识别模型在不同交际语境下的鲁棒性。其元数据字段丰富,除音频路径与转录文本外,还包含带时间戳的转录、模型置信度分数、原始索引及人工核验标记,为模型调试与质量控制提供了多维度的分析依据。整体规模紧凑(600音频片段,约46.6 MB),兼具专业性与实用性,特别适用于领域特定语音识别模型的微调与评测。
使用方法
用户可通过Hugging Face的datasets库便捷加载该数据集,使用from datasets import load_dataset, Audio语句即可获取指定划分(如训练集)的数据。加载后需调用cast_column方法将音频列重采样至16 kHz采样率,以适配主流语音识别模型的输入要求。每条记录均包含audio、text、type等字段,可直接用于模型训练与评估。数据集支持按上下文类型进行过滤或分组分析,便于研究模型在不同语义类别上的表现差异,为石油天然气领域的语音识别应用提供定制化的数据支撑。
背景与挑战
背景概述
石油天然气工业作为全球能源支柱,其日常作业中充斥着大量专业术语与特定沟通场景,对通用语音识别系统构成严峻挑战。为此,由俄罗斯研究者Н. Р. Провоторов主导,于近期构建了专用于俄语石油天然气领域的自动语音识别数据集oil_and_gas_speech。该数据集包含600个经过分类的音频片段,覆盖专业词汇、连接词、疑问句及噪声四类语境,旨在通过微调提升ASR模型对行业术语与特殊表达的理解能力。该资源的诞生填补了俄语工业领域语音数据的空白,为相关技术落地提供了关键基准,对推动能源行业的智能化进程具有重要影响。
当前挑战
该数据集核心解决的两类挑战在于:其一,领域适应难题——通用ASR模型对石油天然气行业的高频专业术语(如钻井、泵压等)及特殊句型(如操作指令问句)识别率极低,因缺乏领域数据而难以泛化;其二,构建过程中的质量控制挑战——原始音频源自复杂作业环境,包含机械噪声、不完整句法(如连接词与填充音)及强方言口音,需通过Whisper模型初步转录后,基于置信度筛选与人工校验(已对验证集、测试集及20%低置信度训练样本逐条核查)确保标注精度,同时平衡四类样本的分布比例,以模拟真实通信场景的多样性。
常用场景
经典使用场景
在石油天然气这一专业领域中,自动语音识别(ASR)模型常因通用语料库的匮乏而难以精准捕捉行业术语和特定语境。oil_and_gas_speech 数据集专为俄语语音识别系统在油气场景下的微调而设计,包含600个经人工校验的音频片段,覆盖术语词汇、连接结构、疑问句式及噪声干扰四类上下文。其经典使用场景聚焦于提升ASR模型对领域专有名词和口语化表达的识别鲁棒性,尤其适用于智能语音助手、现场操作指令转录及安全监控语音分析等任务。通过引入类型标签和置信度评分,研究者可系统评估模型在不同交际场景下的表现,从而定向优化识别精度。
解决学术问题
该数据集有效回应了行业ASR研究中两大核心挑战:稀缺术语的识别偏移和噪声环境下的语义混淆。学术上,它填补了俄语油气领域高标注质量音语料库的空白,为领域自适应迁移学习提供了基准。研究者可据此探究上下文类型对识别性能的影响机制,例如比较模型在技术术语与口语连接词上的错误分布,或量化噪声干扰下的解码稳定性。此外,数据集中人工验证的难例样本为难例挖掘(hard example mining)方法提供了实证基础,推动了对低置信度序列的修正策略研究。其分层抽样策略亦为小样本场景下的鲁棒性评估设计了可复现的实验框架。
衍生相关工作
围绕 oil_and_gas_speech,已衍生出多项针对工业领域低资源语音识别的代表性工作。一方面,研究者利用该数据集验证了Whisper模型在俄语油气术语上的微调策略,并开源了预处理脚本和置信度过滤链路,形成了可复现的领域适应流水线。另一方面,数据集的类型标签启发了多层次解码架构的设计,例如将术语优先的注意力机制嵌入端到端模型,或依据上下文类别动态调整语言模型权重。部分工作还探索了利用该数据集训练噪声分类器,进而与ASR模块联合优化,在模拟油气场站的混合音频测试中取得了显著的词错误率降低。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务