遇见数据集

zwesui-grupa-4-medyczn

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

该数据集是一个专门用于评估波兰语自动语音识别(ASR)系统的参考语料库,聚焦于医学领域,特别是胰腺相关疾病、诊断影像学(如超声、CT、MRI)描述以及实验室检查结果(如胰腺酶、炎症参数)的术语。数据集在语音识别系统评估研讨会(UAM WMI,2026版,第4组)框架下创建,旨在为波兰语医学领域ASR提供标准化的测试基准。数据内容由波兰语的短语音片段构成,主题紧密围绕胰腺医学、影像诊断、临床症状及检验报告。音频来源包含两类:一是从遵循CC-BY许可的YouTube教育视频中截取的片段(标记为youtube),二是为补充特定领域内容而生成的合成语音(标记为edge_tts)。所有语音片段的转录文本均依据统一的规范化协议进行处理,确保作为ASR评估参考文本的一致性。数据集中还包含了丰富的元数据,如匿名化的标注者与验证者标识符、音频来源URL、对应的许可证信息,并将语音类型统一标注为read(朗读语音)。数据集以结构化文件形式组织:音频文件为16 kHz单声道PCM格式的WAV文件,存放于`audio/pl/`目录下;转录及元数据则存储于`transcript/pl/test.tsv`的TSV文件中。该TSV文件包含16个字段,遵循特定的数据模式,核心字段包括音频文件路径、规范化后的参考转录文本、固定领域标签medyczna(医学)、音频来源、语音类型、标注与验证者匿名ID、以及来源链接与许可证。该数据集主要适用于波兰语ASR模型的性能评估、比较研究和基准测试,尤其适用于分析模型在专业医学术语、数字单位、缩写等方面的识别能力,以及探究不同音频来源(自然人类语音与合成语音)对识别错误率(WER/CER)的影响。使用本数据集时需注意其局限性:领域范围较窄(集中于胰腺相关医学),可能限制其向其他医学子领域的泛化能力;YouTube来源的音频质量可能参差不齐;合成语音的声学特征可能与真实人声存在差异;数据存在一定的主题与词汇偏差;且采用的文本规范化规则会直接影响评估指标的计算结果,在进行跨模型或跨研究比较时需确保使用相同的预处理协议。数据集整体采用CC-BY 4.0许可证发布。

创建时间:
2026-06-03
原始信息汇总

数据集概述:Polski korpus ASR — grupa 4 (mowa medyczna, trzustka i obrazowanie)

  • 数据集标识符: amu-cai/zwesui-grupa-4-medyczna
  • 语言: 波兰语
  • 领域: 医学(专注于胰腺、诊断影像、症状及实验室检查)
  • 许可证: CC-BY-4.0
  • 数据集来源: https://huggingface.co/datasets/amu-cai/zwesui-grupa-4-medyczna

目的与研究方向

该数据集是一个参考性测试集,用于评估波兰语自动语音识别(ASR)系统在医学领域的表现。特别关注胰腺疾病、影像学检查(如USG、CT、MRI)及相关实验室结果(如胰腺酶、炎症参数)相关术语。

主要目标包括:

  • 在标准化协议下比较不同ASR模型的表现。
  • 识别典型错误来源(专业术语、数字与单位、缩写、检查名称)。
  • 评估音频来源类型(YouTube vs TTS)对WER/CER的影响。

示例研究问题:

  1. 医学领域(专业术语)相比通用波兰语语料库,对WER/CER的恶化程度如何?
  2. 哪类词元最困难:数字、单位、检查缩写、解剖名称、药物?
  3. ASR结果在YouTube录音(自然条件)与TTS(清晰发音)之间是否存在显著差异?
  4. 哪些模型(如Whisper、Conformer、wav2vec2)对医学词汇最鲁棒?
  5. 标准化协议(如数字写法、标点、缩写)如何影响报告的WER/CER?

数据集描述

数据集由短时长的波兰语语音片段组成,内容与医学领域相关(胰腺、诊断影像、症状及检查结果)。

音频来源:

  • youtube:从YouTube教育视频中截取的片段(CC-BY许可证,每段音频在source_url中附有链接)。
  • edge_tts:合成的补充音频。

标注与验证:

  • 转录根据标准化协议(normalize.pynormalization-protocol_updated.md)准备并标准化。
  • annotatorverified_by字段使用化名anon_<8hex>(伪匿名化)。
  • 每段音频附有来源与许可证元数据(source_urlsource_license),支持来源审计。

分段标准:

  • 片段应为连贯的短语或句子(speech_type=read)。
  • 避免在单词中间截断或语音重叠占主导的部分。
  • 偏好清晰度足够进行可靠转录的片段。

文件结构

  • audio/pl/grupa4-yt-NNNN.wav:来自YouTube的音频片段。
  • audio/pl/grupa4-tts-NNNN.wav:合成音频片段。
  • transcript/pl/test.tsv:包含16个字段的TSV文件。

TSV字段说明:

字段 说明
path 16 kHz单声道PCM WAV文件的相对路径
sentence 标准化后的转录(ASR参考文本)
domain medyczna(医学)
source youtubeedge_tts
speech_type read(朗读语音)
annotator, verified_by 化名anon_<hash>
source_url, source_license 音频来源及许可证

局限性

  • 领域限制: 数据集聚焦于狭窄的医学子领域(胰腺与诊断影像),结果可能不泛化到其他专业。
  • 音频来源: YouTube音频可能包含噪声、压缩、口音变化及录音条件差异,影响与录音室录音的可比性。
  • TTS数据: 合成数据在声学和韵律上可能与人类语音不同,模型可能在这些数据上获得异常好的表现。
  • 主题与词汇偏差: 特定术语和句型过度代表,可能偏向于在类似数据上微调的模型。
  • 标准化影响: 标准化规则(如数字写法、单位、标点)影响WER/CER结果;比较应使用完全相同的协议。

个人数据与GDPR

  • annotatorverified_by字段已伪匿名化(SHA-256 + 盐值,格式anon_<8hex>)。
  • YouTube音频使用CC-BY许可证(链接见source_url)。
  • TTS录音不包含人类声音;脚本文本由团队编写。

引用

bibtex @misc{zwesui-grupa-4-medyczna, title = {Polski korpus ASR — grupa 4 (mowa medyczna, trzustka i obrazowanie)}, author = {Zespół grupa 4, Warsztaty ASR UAM WMI 2026}, year = {2026}, url = {https://huggingface.co/datasets/amu-cai/zwesui-grupa-4-medyczna}, note = {Hugging Face dataset amu-cai/zwesui-grupa-4-medyczna} }

联系与代码

实验仓库:https://git.wmi.amu.edu.pl/s512760/projekt-grupa4-Warsztaty-z-ewaluacji-asr

搜集汇总
数据集介绍
zwesui-grupa-4-medyczn 数据集图片
构建方式
该语料库专为波兰语医学领域的自动语音识别(ASR)系统评估而构建,聚焦于胰腺疾病相关的诊断影像描述、症状及实验室检查结果。音频数据源自两个渠道:其一是从YouTube上获取的、遵循CC-BY许可的教育视频片段,经切割后形成自然语音段;其二是利用Edge TTS引擎合成的补充性音频,以丰富领域覆盖。所有音频均被分割为连贯的朗读式短语或句子,并统一转换为16 kHz单声道PCM格式的WAV文件。转录文本依据一套标准化的规范化协议(包含normalize.py脚本及协议文档)进行处理,确保数字、单位、缩写等元素的一致性。每条记录均附有来源URL、许可证信息以及经伪匿名化处理的标注者与验证者标识(anon_<8hex>格式),从而保障数据的可追溯性与隐私合规性。
特点
该数据集的一大特色在于其明确聚焦于狭窄而专业的医学子领域——胰腺与影像诊断,这使其成为评估ASR系统在高度专业化术语下表现的关键基准。数据来源的二元性(自然YouTube语音与合成TTS)为研究者提供了独特的对比视角,可量化分析音频质量与声学环境对词错误率(WER)和字符错误率(CER)的影响。此外,数据集的构建遵循统一的标准化协议,有效消除了不同标注者之间的符号差异,使跨模型的性能比较更为公平可靠。每个语段的元数据(如领域、来源、语音类型)均被详细记录,便于进行细粒度的错误分析,例如识别模型在处理数字、医学缩写、解剖名词及药物名称时的薄弱环节。
使用方法
该数据集的核心用途是作为波兰语医学领域ASR系统的标准化测试基准。用户可加载`transcript/pl/test.tsv`文件获取参考转录文本与音频路径,并使用任意ASR模型(如Whisper、Conformer或wav2vec2)对音频文件夹`audio/pl/`下的WAV文件进行解码。为保持评估结果的可比性,研究者必须严格遵循数据集提供的归一化协议(即应用`normalize.py`脚本)对模型输出进行后处理,再计算WER或CER指标。此外,通过`source`字段可分别统计YouTube与TTS子集的性能差异,而`sentence`内容则支持对特定术语类别(如数字、单位、缩写)的分组错误分析。该数据集亦可用于微调开源的波兰语ASR模型,提升其在医学文本上的识别鲁棒性。
背景与挑战
背景概述
该数据集创建于2026年,由波兰亚当·密茨凯维奇大学(UAM)数学与计算机科学学院(WMI)的研究团队在“语音识别系统评估”研讨会框架下构建。核心研究问题聚焦于开发一个针对波兰语医学领域的自动语音识别(ASR)系统参考测试集,特别关注胰腺疾病相关的影像诊断描述、症状及实验室检查结果。通过整合YouTube上的教育材料(遵循CC-BY许可)与合成语音(TTS)片段,并依据统一的规范化协议(normalize.py)进行转录,该数据集旨在评估ASR模型在专业医学词汇、数字、单位及缩写等复杂语言元素上的表现。其影响力体现在为波兰语ASR领域提供了首个面向狭窄医学子领域(胰腺与影像学)的标准评估基准,促进了模型在专业术语和跨源音频(自然语音与合成语音)场景下的对比与优化。
当前挑战
数据集面临的挑战包括三类:其一,领域问题层面,医学专业术语(如解剖名词、检查缩写、药品名称)以及数字、单位和实验室参数的高频出现,显著提升了ASR模型的词汇外(OOV)错误率,亟需模型具备对稀疏且高度专业化语言建模的鲁棒性。其二,构建过程中,音频源多样性带来质量差异——YouTube片段包含环境噪声、压缩伪影和可变语速,而TTS合成语音虽音质纯净但缺乏自然韵律和口型变化,这种异质性要求数据集能够分离出源依赖性对词错误率(WER/CER)的影响。其三,规范化策略的统一性挑战:不同的数字书写、标点处理和缩写扩展规则直接影响评估结果的可比性,因此需采用标准化的TSV格式和预处理协议,防止因后处理差异导致的性能误判。此外,话题与词汇偏差(仅覆盖胰腺影像学)限制了跨医学专科的泛化能力,需谨慎解释面向通用医学场景的评估结论。
常用场景
经典使用场景
在语音识别(ASR)领域,该数据集作为波兰语医学语音的参照测试集,经典使用场景是评估和比较不同ASR模型在医学特定术语上的识别性能。研究人员通过标准化协议和TSV格式,利用该数据集测试Whisper、Conformer、wav2vec2等模型在胰腺疾病诊断、影像学描述及实验室参数相关的语音片段上的字错误率(WER)和字符错误率(CER),从而分析模型在专业词汇、数字、单位和缩写等复杂语义单元上的鲁棒性。
实际应用
在临床信息系统的集成应用中,该数据集可模拟医生口述影像报告、实验室结果和病历摘要的真实场景,助力ASR系统部署于波兰医院的语音录入模块,实现高精度的医学文档自动生成。医疗教育领域可利用该数据集训练智能辅导系统,将教学视频中的专业讲解实时转录,辅助学生理解胰腺影像与实验室参数;同时促进多模态患者数据的结构化提取。
衍生相关工作
该数据集衍生了多类经典工作:一是基于分层错误分析的ASR模型对比研究,深入解析不同模型对数字及缩写等类别token的敏感度;二是跨领域域迁移学习探索,利用该数据集将通用波兰语ASR模型微调至医学场景;三是数据增强研究,通过合成TTS语音与真实YouTube片段融合,提升模型在临床噪声环境下的泛化性。此外,标准化评估协议的制定也推动了可重复ASR评价体系的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务