遇见数据集

speech_attempt_pronunciation_analysis

收藏
Hugging Face2026-05-22 更新2026-05-23 收录
官方服务:

资源简介:

该数据集名为speech_attempt_pronunciation_analysis,是一个用于语音发音分析的数据集。数据集包含1000个训练样本,总大小约为268MB。每个样本包含丰富的多模态信息,具体字段包括:问题文本(question, question_content)、口语部分标识(speaking_part, question_part_type)、音频转录文本(transcription)、检测到的语言(detected_language)、句子列表(sentences)、数据来源信息(source_dataset, source_split, source_index, record_id)、参考文本信息(reference_field, reference_type, reference_text)、音频处理元数据(triton_model_name, audio_num_samples, audio_sampling_rate, audio_duration_seconds, processing_error)以及详细的发音和语言能力评估指标,如发音评分(pronunciation_score)、IELTS分数(ielts_score)、效率百分比(eff_per)、清晰度/模糊度/破碎度比率(r_clear, r_blurred, r_broken)、词汇和音素计数(word_count, phoneme_count)以及结构化评估数据(assessment_json, fluency_xml)。数据集适用于语音发音评估、口语流利度分析、语言能力测试(如IELTS)等相关任务的研究与开发。

创建时间:
2026-05-21
原始信息汇总

数据集概述

数据集名称:speech_attempt_pronunciation_analysis

数据集来源:Hugging Face Datasets(地址:https://huggingface.co/datasets/bihungba1101/speech_attempt_pronunciation_analysis)

数据集规模

  • 训练集(train):包含 1000 个样本,总字节数约为 268.68 MB
  • 下载大小:约 33.16 MB

特征字段说明

字段名 数据类型 描述
question string 问题文本
question_content string 问题内容
speaking_part string 发言部分
question_part_type string 问题部分类型
transcription string 语音转写文本
detected_language string 检测到的语言
sentences list of string 句子列表
source_dataset string 来源数据集
source_split string 来源数据集划分
source_index int64 来源数据索引
record_id string 记录 ID
reference_field string 参考字段
reference_type string 参考类型
reference_text string 参考文本
triton_model_name string Triton 模型名称
audio_num_samples int64 音频样本数
audio_sampling_rate int64 音频采样率
audio_duration_seconds float64 音频时长(秒)
processing_error string 处理错误信息
pronunciation_score float64 发音评分
ielts_score float64 雅思得分
eff_per float64 EFF 表现
r_broken float64 破裂音评分
r_blurred float64 模糊音评分
r_clear float64 清晰音评分
word_count int64 单词数量
phoneme_count int64 音素数量
assessment_json string 评估 JSON 数据
fluency_xml string 流利度 XML 数据

数据集用途:该数据集主要用于语音发音分析,包含转录文本、发音评分、雅思得分、流利度评估等多维度信息,适用于语音识别、发音评估、口语能力分析等任务。

配置信息

  • 配置名称:default
  • 数据文件路径:data/train-*
搜集汇总
数据集介绍
speech_attempt_pronunciation_analysis 数据集图片
构建方式
该数据集旨在为语音发音分析提供高质量的训练与评估资源,其构建过程融合了多源语音数据采集与自动化标注技术。原始数据来源于多个公开语音数据集,经筛选后保留涵盖不同口音、语速与录制环境的音频样本。每段音频均通过语音识别系统转写为文本,并提取出分句、语种检测结果与发音特征。进一步地,利用专有的发音评估模型对每个语音样本进行多维度的量化打分,包括整体发音得分、模拟雅思口语分数、音素错误率以及清晰度、模糊度与破碎度的比例。此外,数据集还包含了完整的评估JSON与流利度XML结构信息,以支持深入的发音质量分析。
特点
该数据集的核心特色在于其多维度的发音评价指标体系与丰富的结构化元数据。每个样本不仅记录了音频的基础属性如采样率、时长与采样点数,还提供了从音素到词级别的详尽评估指标,包括pronunciation_score、ielts_score、eff_per等量化值。同时,distinct字段如r_broken、r_blurred与r_clear分别反映了发音的破碎、模糊与清晰程度,使得研究者可以精细化地分析发音缺陷。数据集还包含了源数据集来源与索引、录音ID、参考文本与参考类型等溯源信息,增强了数据可追溯性。此外,通过assessment_json与fluency_xml字段,用户可获得完整的评估结构化数据,便于进行自定义分析与模型训练。
使用方法
该数据集主要以HuggingFace Datasets库格式提供,用户可通过标准的数据加载接口直接获取训练集,数据以parquet或arrow格式高效存储,便于大规模机器学习流水线。使用时,研究人员可将audio_num_samples与audio_sampling_rate字段用于构建音频特征,结合pronunciation_score等标签进行回归或分类任务。对于发音评估模型的微调,建议将question、transcription与reference_text作为输入文本特征,而将pronunciation_score与ielts_score作为监督标签。此外,针对多语言语音识别与发音纠错研究,detected_language与参考文本字段可辅助跨语言分析。评估指标计算时,可参考eff_per与ielts_score等分数进行模型性能对比。
背景与挑战
背景概述
语音发音分析是语音处理与语言学习交叉领域的重要研究方向,其核心目标是通过自动化手段评估学习者的发音质量。该数据集由相关研究机构于近年来构建,旨在为英语口语发音评测提供标准化基准。数据集涵盖1000条语音样本,每条样本包含学习者对特定问题的回答、对应的文本转写、检测语言、发音得分、雅思口语分数及多项发音细粒度指标(如音素错误率、清晰度等)。数据集的设计聚焦于二语习得中的发音可理解性评估,推动了从传统人工评分向自动化评估的范式转变,为语音教育技术提供了关键的数据支撑。
当前挑战
该数据集面临的核心挑战在于发音评估中主观性与客观性的平衡。首先,发音评分需整合语音准确性、流利度与韵律特征,而不同评估标准(如雅思口语评分体系与自动语音识别指标)间的对齐存在固有矛盾。其次,构建过程中需应对多语言背景学习者的口音多样性,数据集虽检测到语种信息,但非母语口音的复杂声学变异对音素边界检测与错误定位提出了更高要求。此外,数据采集的标注一致性挑战显著,人工转写与机器评估间的偏差、评分维度的细粒度划分(如清晰度与模糊度比例的计算)均需精密的设计与验证。
常用场景
经典使用场景
在第二语言习得与口语评估研究中,该数据集被广泛用于构建和验证发音质量自动评价系统。研究者可借助其中包含的发音分数、IELTS分数、音素级准确率等细粒度标注,训练回归或分类模型以预测学习者口语水平。这些数据还支持对语音流利度、清晰度与破碎度等维度进行多模态分析,从而构建更加立体化的口语能力评估框架。
实际应用
在实际场景中,该数据集可驱动智能语言学习辅助工具的开发,为在线教育平台提供实时口语纠音与评分服务。基于这些数据的模型能够嵌入至口语练习APP中,针对用户发音给出即时反馈,识别如辅音含糊、元音偏差等具体问题。此外,它还能用于雅思等标准化考试的口语模拟训练系统,帮助考生精准定位发音薄弱环节。
衍生相关工作
该数据集催生了一系列关于多语言发音评估的前沿工作,推动了从音素级分析到篇章级流利度建模的研究范式演进。有学者基于其声学特征开发了跨语种迁移学习模型,另有工作利用其中的比对数据构建了发音错误检测的端到端系统。在测评领域,该数据集还被用作基准,验证了多种非自回归与对抗训练方法在口语自动评分中的有效性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务