遇见数据集

HALAS

收藏
Hugging Face2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

HALAS(大规模自动语音识别系统幻觉标注数据集)是一个针对现代自动语音识别(ASR)系统在真实世界语音录音中产生的幻觉进行人工标注的数据集。该数据集基于Earnings22语料库的录音,包含3,611个音频文件,提供了片段级别的幻觉标注,涵盖幻觉片段、循环错误和幻觉循环错误,并包括修正后的参考转录文本和多个ASR模型的预测结果。数据集支持自动语音识别、幻觉检测、幻觉缓解、错误检测、语音识别评估和语音处理研究等任务,语言为英语,源录音来自27个国家发言人的财报电话会议。数据集分为训练集(2,866个样本)和测试集(745个样本),分割依据源会议进行分层。需要注意的是,HALAS有意构建为包含高比例幻觉,作为幻觉检测和分析的基准,而非日常ASR使用的代表性样本。

HALAS (Hallucination Annotations for Large-scale Automatic Speech Recognition Systems) is a human-annotated dataset for hallucinations produced by modern automatic speech recognition (ASR) systems in real-world speech recordings. Based on recordings from the Earnings22 corpus, the dataset provides segment-level hallucination annotations for ASR outputs. It includes 3,611 audio files, with annotations for hallucination segments, loop errors, and hallucination-loop errors, along with corrected reference transcripts and predictions from multiple ASR systems. The dataset supports tasks such as automatic speech recognition, hallucination detection, hallucination mitigation, error detection, speech recognition evaluation, and speech processing research. The language is English, with source recordings from earnings calls of speakers from 27 countries. It is split into a training set (2,866 samples) and a test set (745 samples), stratified by source meeting, average word error rate, hallucination rate, and audio duration. Note that HALAS is intentionally constructed with a high proportion of hallucinations to serve as a benchmark for hallucination detection and analysis, rather than representing typical ASR usage in the real world.

创建时间:
2026-06-15
原始信息汇总

数据集概述

HALAS (Hallucination Annotations for Large-scale ASR Systems) 是一个人工标注的数据集,专注于现代自动语音识别(ASR)系统在真实语音录音中产生的幻觉现象。该数据集包含针对 Earnings22 语料库中录音生成的 ASR 输出的片段级幻觉标注。

数据集构成

  • 来源:源自 Earnings22 数据集,包含约 119 小时的财报电话会议录音,发言人来自 27 个国家,覆盖多种真实录音条件。
  • 规模:共 3,611 个音频文件。
  • 数据分割
    • 训练集:2,866 个样本
    • 测试集:745 个样本
  • 分割策略:按来源会议分割,并根据平均词错误率、幻觉率和音频时长进行分层。

数据字段

每个样本包含以下字段:

字段名称 描述
audio_id 来自 Earnings22 的音频片段唯一标识符
audio_duration 音频片段时长(秒)
e22_reference_text Earnings22 提供的原始参考转录文本
corrected_reference_text 人工校正后的参考转录文本
model_prediction 对应 ASR 模型生成的预测文本
model_label 语句级幻觉标签(布尔值),指示是否存在幻觉
model_hallucination_text 被标注为幻觉的文本片段
model_hallucination_json 包含幻觉位置和类别的结构化标注信息
split 数据集划分(traintest

model 对应的 ASR 系统包括:whisper_large_v2whisper_large_v3whisper_large_v3_turbocrisper_whispercanarycanary_flashparakeetphi4granite(带 * 的模型在 Earnings22 上训练过)。

支持任务

  • 自动语音识别
  • 幻觉检测
  • 幻觉缓解
  • 错误检测
  • 语音识别评估
  • 语音处理研究

标注方法

  • 标注团队:10 名专业标注员,英语水平达到 B2 或以上。

  • 标注流程

    1. 审听音频并识别音频质量问题。
    2. 在听音频的同时审阅 ASR 预测结果。
    3. 使用以下分类法标记幻觉片段:
      • 幻觉:与音频中任何语音内容无关的词或短语。
      • 循环:语音信号中存在的词或短语的错误重复。
      • 幻觉循环:本身为幻觉且与音频信号无关内容的错误重复。
    4. 由第二位标注员独立重复上述过程。
    5. 由第三位标注员解决分歧并最终确定标注。
  • 质量控制

    • 每个样本由两位独立标注员审阅。
    • 标注员间的一致性较高(Cohens κ = 0.87)。

数据集特征

  • 语言:英语。
  • 数据特性:通过选择模型间分歧大的音频片段,有意提高了数据集中幻觉的比例。因此,该数据集的幻觉率不代表真实部署环境中的情况。
    • 训练集幻觉率:33.6%
    • 测试集幻觉率:22.6%
  • 音频来源:Earnings22 数据集的音频,可通过 distil-whisper/earnings22 在 Hugging Face Datasets 上获取。

偏差、风险与局限性

  • 故意对困难音频进行过采样,幻觉频率不代表真实场景。
  • 偏向于导致 ASR 系统间分歧的音频样本。
  • 结果不应被解释为生产系统中幻觉普遍性的估计。
  • 仅关注英文财报电话会议录音,可能无法泛化到其他领域、语言或声学环境。
  • 部分音频样本包含口音、低质量录音或部分听不清楚的语音等挑战性条件。
  • 尽管参考文本已手动校正,某些录音因音质差而本身具有歧义性。

推荐用途

  • 主要用作幻觉检测与分析的标准基准,而非日常 ASR 使用的代表性样本。
  • 使用时,应说明评估是在语句级还是片段级进行。
  • 解释结果时需考虑人为升高的幻觉率。
  • 区分幻觉与普通转录错误。

许可信息

  • HALAS 衍生自 Earnings22 数据集,后者采用 Creative Commons Attribution-ShareAlike 4.0 International (CC BY-SA 4.0) 许可。
  • 用户需同时遵守 Earnings22 许可条款以及 HALAS 数据集本身的条件。官方许可条款请查阅 HALAS 官方仓库。

来源与引用

  • 仓库:https://github.com/DSP-AGH/HALAS/tree/main
  • 论文:Barański et al., "HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems", Proceedings of Interspeech 2026

联系方式

  • Mateusz Barański:mbaranski@agh.edu.pl
  • Jan Jasiński:jjasinsk@agh.edu.pl
  • 也可通过官方仓库的 issue 追踪器联系。
搜集汇总
数据集介绍
HALAS 数据集图片
构建方式
HALAS(Hallucination Annotations for Large-scale ASR Systems)数据集源自Earnings22语料库中的真实财报电话会议录音,旨在捕捉现代自动语音识别系统在真实语音上自然产生的幻觉现象。构建过程中,研究团队首先利用多个前沿ASR系统对音频片段进行转录,并依据模型间词错误率的平均差异筛选出分歧最大的片段作为候选,从而富集幻觉样本。随后,10名具备B2及以上英语水平的专业标注员独立对每个音频片段进行人工审核,识别并标注文本级别的幻觉、循环错误及幻觉循环错误。每份样本由两位标注员独立完成,争议由第三位仲裁员裁定,最终形成包含训练集2866条、测试集745条的高质量标注数据。
特点
该数据集的核心特色在于其专注于真实语音场景下自然发生的ASR幻觉,而非人工合成或非语音音频。数据集提供了Utterance级别的二值标签和Span级别的结构化标注,涵盖幻觉文本位置与类别,并收录了Whisper、Canary、Parakeet、CrisperWhisper等九种主流ASR模型的预测结果及对应的标注信息。此外,原始参考文本经过了人工复核与修正,约14%的样本因部分不可听或歧义被标记,保证了标注的严谨性。标注员间的一致性高达Cohen's κ=0.87,体现了标注过程的高度可靠性。尽管数据集有意过采样了困难片段,不反映真实部署中的幻觉发生率,但其真实音频来源与细粒度标注为幻觉检测与缓解研究提供了极具价值的基准。
使用方法
HALAS适用于多个自然语言处理与语音研究任务,包括ASR幻觉检测、误差分析、参考无关及参考相关幻觉度量评估,以及鲁棒ASR系统的开发。用户可通过HuggingFace Datasets库加载数据集,并使用其提供的train与test分割进行模型训练与基准测试。数据集以CSV格式存储,每个样本包含音频ID、时长、校正后的参考文本、各模型的预测文本与标签,以及幻觉Span的文本与JSON结构化信息。研究者可以基于Utterance级标签进行二分类任务,或利用Span级标注进行序列标注与定位。值得注意的是,由于测试集仅保留时长超过1秒且包含至少3个单词的片段,使用时应严格按照官方分割进行评估,并注意数据集偏高的幻觉率以避免对真实场景的过度推断。
背景与挑战
背景概述
HALAS(Hallucination Annotations for Large-scale ASR Systems)是由AGH科技大学信号处理研究组于2026年创建的人工标注数据集,旨在系统性地捕捉现代自动语音识别系统在真实语音录音中产生的自然幻觉现象。该数据集基于Earnings22语料库,涵盖来自27个国家发言人的财报电话会议录音,并针对Whisper、Canary、Parakeet等主流ASR模型的输出进行了精细的文本跨度级幻觉标注。其核心研究问题在于,先前大多数关于ASR幻觉的检测与缓解方法均依赖于非语音音频或人为破坏的语料,缺乏对自然发生幻觉的真实评估基准,HALAS的出现填补了这一关键空白,为幻觉检测、缓解策略及鲁棒性分析提供了高质量的标准化评测平台。
当前挑战
HALAS所应对的领域挑战在于,ASR系统在实际应用中频繁产生无音频对应关系的幻觉内容,严重削弱了语音识别的可信度与实用性,而现有研究缺乏针对自然语音条件下幻觉的可靠检测与量化方法。数据集构建过程中面临多重困难:首先,需要从大量录音中筛选出幻觉高发片段,研究团队采用模型间不一致性策略进行优先标注,通过平均词错误率比较确保样本代表性;其次,人工标注要求严格区分幻觉、循环错误及幻觉循环三类异常,10名专业标注员需在独立审核基础上经由仲裁达成一致,最终Cohen’s κ达到0.87的高一致性;此外,原始参考文本必须经过人工重新验证与校正,其中约14%的样本被发现部分听不清或存在歧义,进一步增加了标注工作的复杂性。
常用场景
经典使用场景
HALAS数据集专为现代自动语音识别(ASR)系统中的幻觉现象研究而设计,其最经典的使用场景是作为ASR幻觉检测与分析的基准测试集。研究人员可利用该数据集中的真实语音录音与人类标注的幻觉文本片段,评估各类ASR系统在自然语音环境下生成幻觉的程度与模式。通过比较不同模型(如Whisper系列、Canary、Parakeet等)在同一音频上的预测输出与人类标注的金标准,可以系统性地量化幻觉发生的频率、类型及文本特征,从而推动对ASR系统输出可靠性的深入理解。
实际应用
在实际应用中,HALAS数据集可服务于语音转写服务的质量控制与安全审计。依托该数据集,企业能够训练和验证自动化幻觉检测模型,实时识别并标记ASR输出中可能误导用户的虚假信息,从而提升会议记录、字幕生成、语音助手等产品的可靠性。此外,数据集中的多模型标注框架也可用于评估不同规模与架构的ASR系统在金融、医疗等高风险领域部署时的幻觉风险,辅助研发团队在产品迭代中有针对性地缓解幻觉问题。
衍生相关工作
HALAS的发布催生了一系列衍生研究工作。在幻觉检测层面,研究者基于该数据集开发了参考无关的检测方法,如利用语言模型或对比学习机制从转录文本中自动识别幻觉片段。在缓解策略方面,相关工作探索了温度调整、集束搜索约束、以及后处理修正等方法来降低幻觉发生率。此外,也有工作将HALAS中的标注数据用于训练更鲁棒的ASR模型,通过反向传播幻觉标注信息来引导模型学习避免产生无依据的输出。这些工作共同推动了ASR系统从单纯追求低词错率向关注输出真实性转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务