遇见数据集

HALAS (Hallucination Annotations for Large-scale ASR Systems)

收藏
github2026-06-19 更新2026-07-03 收录
数据链接:
官方服务:

资源简介:

HALAS(大规模ASR系统幻觉标注)是一个人类标注的数据集,包含现代自动语音识别系统在真实世界语音录音中产生的幻觉。该数据集提供了基于Earnings22语料库录音生成的ASR输出的跨度级幻觉标注,旨在解决先前幻觉研究的关键限制,支持幻觉检测、缓解和分析方法的现实评估。

HALAS (Large-Scale ASR System Hallucination Annotation) is a human-annotated dataset containing hallucinations generated by modern automatic speech recognition systems on real-world speech recordings. This dataset provides span-level hallucination annotations for ASR outputs derived from recordings in the Earnings22 corpus, aiming to address key limitations of prior hallucination research and enable realistic evaluation of hallucination detection, mitigation, and analysis methods.

创建时间:
2026-06-16
原始信息汇总

数据集概述

HALAS (Hallucination Annotations for Large-scale ASR Systems) 是一个由人工标注的数据集,专注于现代自动语音识别(ASR)系统在真实世界语音录音中产生的幻觉现象。该数据集为来自 Earnings22 语料库的录音生成的 ASR 输出提供了跨度级别的幻觉标注。

HALAS 旨在解决先前幻觉研究中的关键局限:大多数现有的幻觉检测和缓解方法是在非语音音频或人为损坏的语音上评估的。相比之下,HALAS 捕捉的是真实语音录音中自然发生的幻觉,从而能够对幻觉检测、缓解和分析方法进行更现实的评估。

该数据集包含多个最先进的语音识别系统生成的 ASR 输出标注,并提供语句级标签和识别幻觉内容的跨度级标注。

HALAS 旨在作为以下任务的基准:

  • ASR 幻觉检测
  • 幻觉缓解研究
  • 语音识别系统的错误分析
  • 基于参考和无参考幻觉指标的评估
  • 稳健 ASR 系统的开发

数据集详情

数据集包含来自 Earnings22 数据集的 3,611 个音频文件,并附有经过人工验证和修正的标注。

对于每个音频片段,收集了多个最先进 ASR 模型的预测结果,并由人工标注员独立审查。幻觉跨度、循环错误和幻觉循环错误均在文本跨度级别进行标注。

此外,Earnings22 提供的参考转录文本也经过人工重新验证并在必要时进行了修正。


数据集描述

HALAS 由来自 Earnings22 数据集录音的 ASR 转录中人工标注的幻觉组成。

该数据集使用最先进的 ASR 系统对自然发生的财报电话录音进行处理而创建,这些录音包含来自 27 个国家的讲话者以及广泛的录音条件。

为了最大化标注池中幻觉的普遍性,使用模型间不一致性选择候选音频片段。通过比较多个 ASR 系统的预测结果,计算平均配对词错误率(WER),并优先标注具有最高不一致性的片段。

标注过程仅关注音频信号与 ASR 预测之间的关系。标注员被指示在识别幻觉时依赖参考转录文本。

幻觉的定义为:

与 ASR 模型分析的音频信号内容没有语音对应关系的预测或其中的一部分。

标注员使用以下分类系统标记单词或短语:

  • 幻觉:与录音中任何讲话内容不匹配的单词或短语。
  • 循环:语音信号中存在的单词或短语的错误重复。
  • 幻觉循环:本身是幻觉且与音频信号不匹配的内容的错误重复。

每个音频文件由两名标注员独立标注,分歧由第三名标注员仲裁解决。

除幻觉标注外,所有参考转录文本均经过人工审查并在必要时修正。在此过程中,约 14% 的样本被识别为部分听不清或含混不清。

生成的数据集包含:

  • 人工标注的幻觉跨度
  • 人工标注的循环跨度
  • 人工标注的幻觉循环跨度
  • 修正后的参考转录文本
  • 语句级幻觉标签
  • 多个 ASR 系统的预测结果

重要提示:HALAS 被有意构建为包含高比例的幻觉,因此不代表 ASR 幻觉在现实世界中的普遍性。然而,所有幻觉都源自真实的语音录音,而非人为损坏或非语音输入。


支持的任务

  • 自动语音识别(ASR)
  • 幻觉检测
  • 幻觉缓解
  • 错误检测
  • 语音识别评估
  • 语音处理研究

语言

  • 英语

源录音来自财报电话录音,涵盖来自 27 个国家的讲话者。


许可协议

HALAS 衍生自 Earnings22 数据集,并通过人工生成的幻觉标注和修正后的参考转录文本对其进行增强。

原始 Earnings22 数据集在 Creative Commons Attribution-ShareAlike 4.0 International (CC BY-SA 4.0) 许可下公开分发。HALAS 的用户除了遵守本数据集指定的任何条件外,还必须遵守 Earnings22 许可的条款。完整许可文本见:

https://creativecommons.org/licenses/by-sa/4.0/

HALAS 包含作者制作的原始人工标注。除非官方仓库中另有规定,这些标注旨在与源数据集相同的许可下分发,以保持与底层 Earnings22 数据的兼容性。

注意:用户应查阅官方 HALAS 仓库以获取发布版本的权威许可条款。


数据集来源

  • Hugging Face:https://huggingface.co/datasets/MatBar99/HALAS
  • 论文:HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems,作者 Mateusz Barański, Jan Jasiński, Julitta Bartolewska, Marcin Witkowski, 和 Konrad Kowalczyk,已被 Interspeech 2026 录用。

数据字段

数据集包含以下字段:

字段 描述
audio_id 来自 Earnings22 的音频片段唯一标识符
audio_duration 音频片段的时长(秒)
e22_reference_text Earnings22 提供的原始参考转录文本
corrected_reference_text 人工修正后的参考转录文本
model_prediction 对应模型生成的 ASR 预测
model_label 语句级幻觉标签,指示是否存在幻觉
model_hallucination_text 标注为幻觉的文本跨度
model_hallucination_json 包含幻觉位置和类别的结构化跨度标注
split 数据集拆分(traintest

model 字段对应以下 ASR 系统之一:

  • whisper_large_v2
  • whisper_large_v3
  • whisper_large_v3_turbo
  • crisper_whisper
  • canary
  • canary_flash
  • parakeet
  • phi4*
  • granite*

标有星号(*)的模型不属于相关论文的范围,因为它们是在 Earnings22 数据集上训练的。


标注方法

  • 标注员:10 名专业标注员,英语水平达到 B2 级或以上。
  • 标注流程
    1. 听取音频录音。
    2. 识别音频质量问题(例如:非英语语音、讲话者重叠、听不清片段)。
    3. 标注员在听取音频的同时审查 ASR 预测。
    4. 使用 HALAS 分类系统标记幻觉跨度。
    5. 第二名标注员独立重复该过程。
    6. 第三名标注员解决分歧并确定最终标注。
  • 质量控制:每个样本由两名独立标注员审查。标注员间一致性较高,Cohens κ = 0.87。所有参考转录文本均由仲裁员重新验证和修正。

数据拆分

拆分 文件数
训练集 2,866
测试集 745

训练/测试拆分的创建方式:

  • 按源会议拆分。
  • 根据以下因素进行分层:
    • 平均 WER
    • 幻觉率
    • 音频时长

为确保基准的稳定性,测试集仅包含:

  • 时长超过 1 秒的录音
  • 包含至少 3 个单词的录音

数据集统计:

拆分 幻觉率
训练集 33.6%
测试集 22.6%

数据集特征

  • 源音频:来自 Earnings22 数据集——约 119 小时音频、财报电话录音、27 个国家讲话者、真实世界录音条件。
  • 选择策略:从 ASR 系统间高度不一致的部分中选择候选片段。
  • 代表性说明:HALAS 有意识地过度采样了困难的音频片段。因此,幻觉频率不代表真实部署条件,数据集偏向于导致 ASR 系统不一致的样本。

偏见、风险与局限

  1. 幻觉频率不反映现实部署条件。
  2. 数据集偏向于导致 ASR 系统不一致的音频样本。
  3. 在 HALAS 上获得的结果不应被解释为生产系统中幻觉普遍性的估计。
  4. 数据集专注于英文财报电话录音,可能无法泛化到其他领域、语言或声学环境。
  5. 部分音频样本包含口音、低质量录音或部分听不清的语音等挑战性条件。
  6. 尽管参考文本经过手动修正,某些录音由于音频质量差本质上仍然存在歧义。

研究人员应将 HALAS 主要视为幻觉检测和分析的基准,而非日常 ASR 使用的代表性样本。


建议

使用 HALAS 的研究人员应:

  1. 报告评估是在语句级还是跨度级进行的。
  2. 在解释结果时考虑有意提高的幻觉率。
  3. 将幻觉与普通转录错误区分开来。
  4. 同时考虑结构性和语义性评估指标。
  5. 尽可能在其他数据集上评估泛化能力。

由于 HALAS 包含来自真实语音录音的自然发生的幻觉,它提供了比由非语音或人为损坏音频构建的数据集更现实的基准。

搜集汇总
数据集介绍
HALAS (Hallucination Annotations for Large-scale ASR Systems) 数据集图片
构建方式
HALAS 数据集基于 Earnings22 语料库中的真实语音录音构建而成,旨在捕捉现代自动语音识别系统在自然场景下产生的幻觉现象。为了最大化幻觉样本的丰度,研究者采用跨模型不一致性策略,通过计算多个先进 ASR 系统预测结果之间的平均成对词错误率,优先选取分歧最大的音频片段进行标注。标注过程由十名专业标注员独立完成,每位标注员在聆听音频的同时,严格依据幻觉定义——即与音频信号无任何语音对应关系的预测片段——来标记文本跨度,并区分普通幻觉、循环错误及幻觉循环三类错误。每段音频经过双重独立审核后,由第三位仲裁员解决分歧,最终形成包含跨度级标注和校正后参考转录文本的高质量数据集。
特点
HALAS 的核心价值在于其聚焦于真实语音录音中自然涌现的幻觉现象,而非人工合成或非语音音频中的模拟错误,从而为幻觉检测与缓解研究提供了前所未有的现实基准。数据集涵盖了来自 27 个国家发言人的财报电话会议录音,音频质量与声学环境多样,增强了其生态效度。值得注意的是,HALAS 有意过度采样了困难音频片段,使得幻觉比例远高于实际部署场景,因此更适合作为评估幻觉检测方法的基准而非反映真实分布。数据集同时提供话语级标签与跨度级标注,并附有经人工校正的参考文本,支持从细粒度错误分析到系统鲁棒性研究的多层次应用。
使用方法
研究者可通过 Hugging Face 平台直接加载 HALAS 数据集,其包含训练集(2,866 条)和测试集(745 条)两个划分,划分时综合考虑了词错误率、幻觉率与音频时长等因素以保证测试基准的稳定性。数据字段涵盖音频标识符、原始与校正后的参考文本、各 ASR 模型的预测结果、话语级幻觉标签以及结构化的跨度标注 JSON 信息。用户可据此开展语音识别幻觉检测、缓解策略评估、无参考与有参考度量指标的性能比较等任务。建议在报告结果时明确标注评估层级(话语级或跨度级),并注意该数据集幻觉率偏高可能对模型性能估计造成的影响,同时考虑采用结构性与语义性双重度量指标以全面衡量模型表现。
背景与挑战
背景概述
HALAS(Hallucination Annotations for Large-scale ASR Systems)是由波兰AGH科技大学信号处理团队于2026年创建的大规模ASR系统幻觉标注数据集,旨在解决现有幻觉检测研究多依赖非语音音频或人工失真语音的局限性。该数据集基于Earnings22语料库中的真实财报电话录音,涵盖27个国家说话者的多样声学环境,由10名专业标注者采用双重独立标注与仲裁机制,对Whisper、Canary、Parakeet等现代ASR系统的输出进行了细粒度的文本跨度级幻觉标注。HALAS的发布为ASR幻觉检测、缓解及鲁棒性评估提供了首个基于真实语音的自然幻觉基准,显著促进了该领域研究的生态真实性与可复现性。
当前挑战
HALAS所应对的核心领域挑战在于:现代ASR系统在真实语音上产生的幻觉现象缺乏系统化标注与定量评估方法,现有检测手段多局限于非语音或人工加噪场景,无法反映实际部署中的幻觉分布与类型。在构建过程中,团队面临多重困难:首先,需从119小时音频中通过模型间平均词错误率筛选高分歧片段以提升幻觉富集度;其次,标注者需严格区分幻觉、循环错误及组合错误,仅以音频与预测的语音对应性为判据,避免受参考文本干扰;此外,约14%的样本因部分模糊或听不清而需仲裁校正,最终构建了包含3611个音频、具有高标注一致性(Cohen's κ=0.87)的数据集,但刻意设计的幻觉过采样也使其无法代表真实部署中的幻觉发生率。
常用场景
经典使用场景
在自动语音识别(ASR)领域,HALAS数据集的核心价值在于为幻觉检测与缓解提供真实世界场景下的标准化评测基准。不同于以往依赖非语音音频或人为加噪数据的研究,该数据集直接来源于Earnings22语料库中涵盖27国发言者、多种录音条件的真实财报电话会议录音,并针对多个前沿ASR系统(如Whisper系列、Canary等)的输出进行精细的跨模型分歧采样与人工标注。其经典使用场景包括:基于语素或片段级别的幻觉定位与分类(分为幻觉、循环与幻觉循环三种类型),以及结合修正后的参考文本进行参考无关或参考依赖的评估指标开发,从而在接近真实的声学与语言学条件下衡量系统鲁棒性。
实际应用
在实际应用中,HALAS数据集为部署高可靠性ASR系统的关键领域提供了不可或缺的测试资源。例如,在智能会议转录、语音助手、医疗听写及法律记录等场景中,幻觉内容(如虚构词语、语义无关的重复)可能导致严重的信息误判。该数据集通过暴露不同ASR模型在复杂声学环境(如远端拾音、快语速、重口音)下的幻觉模式,支持开发人员设计针对性的后处理滤波器或置信度阈值策略。此外,其跨模型、多系统对比的标注结构可直接服务于产品选型与定制化模型微调,帮助工程团队在实际部署前准确评估系统在少见但高风险幻觉案例上的表现,从而提升语音应用的实用性与用户信任度。
衍生相关工作
HALAS数据集的发布已催生一系列衍生工作,主要聚焦于幻觉检测方法的创新与评估体系完善。据Interspeech 2026收录的相关论文,研究者基于其标注结构开发了多种参考无关的幻觉度量指标,如利用语音-文本跨模态对齐分数的检测器,以及基于语言模型困惑度的单边误识检测算法。在缓解策略方面,出现了结合知识图谱约束的ASR解码修正方案,以及利用对抗训练降低幻觉率的系统改进工作。此外,该数据集还推动了面向动态音频流(如在线会议对话)的在线幻觉监测框架研究,并启发了将声学不确定性量化为模型输出可靠性指标的方法论探索。这些工作共同构成了围绕HALAS的生态系统,持续深化对ASR中枢神经幻觉现象的理解与控制。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务