HALAS (Hallucination Annotations for Large-scale ASR Systems)
收藏资源简介:
HALAS(大规模ASR系统幻觉标注)是一个人类标注的数据集,包含现代自动语音识别系统在真实世界语音录音中产生的幻觉。该数据集提供了基于Earnings22语料库录音生成的ASR输出的跨度级幻觉标注,旨在解决先前幻觉研究的关键限制,支持幻觉检测、缓解和分析方法的现实评估。
HALAS (Large-Scale ASR System Hallucination Annotation) is a human-annotated dataset containing hallucinations generated by modern automatic speech recognition systems on real-world speech recordings. This dataset provides span-level hallucination annotations for ASR outputs derived from recordings in the Earnings22 corpus, aiming to address key limitations of prior hallucination research and enable realistic evaluation of hallucination detection, mitigation, and analysis methods.
数据集概述
HALAS (Hallucination Annotations for Large-scale ASR Systems) 是一个由人工标注的数据集,专注于现代自动语音识别(ASR)系统在真实世界语音录音中产生的幻觉现象。该数据集为来自 Earnings22 语料库的录音生成的 ASR 输出提供了跨度级别的幻觉标注。
HALAS 旨在解决先前幻觉研究中的关键局限:大多数现有的幻觉检测和缓解方法是在非语音音频或人为损坏的语音上评估的。相比之下,HALAS 捕捉的是真实语音录音中自然发生的幻觉,从而能够对幻觉检测、缓解和分析方法进行更现实的评估。
该数据集包含多个最先进的语音识别系统生成的 ASR 输出标注,并提供语句级标签和识别幻觉内容的跨度级标注。
HALAS 旨在作为以下任务的基准:
- ASR 幻觉检测
- 幻觉缓解研究
- 语音识别系统的错误分析
- 基于参考和无参考幻觉指标的评估
- 稳健 ASR 系统的开发
数据集详情
数据集包含来自 Earnings22 数据集的 3,611 个音频文件,并附有经过人工验证和修正的标注。
对于每个音频片段,收集了多个最先进 ASR 模型的预测结果,并由人工标注员独立审查。幻觉跨度、循环错误和幻觉循环错误均在文本跨度级别进行标注。
此外,Earnings22 提供的参考转录文本也经过人工重新验证并在必要时进行了修正。
数据集描述
HALAS 由来自 Earnings22 数据集录音的 ASR 转录中人工标注的幻觉组成。
该数据集使用最先进的 ASR 系统对自然发生的财报电话录音进行处理而创建,这些录音包含来自 27 个国家的讲话者以及广泛的录音条件。
为了最大化标注池中幻觉的普遍性,使用模型间不一致性选择候选音频片段。通过比较多个 ASR 系统的预测结果,计算平均配对词错误率(WER),并优先标注具有最高不一致性的片段。
标注过程仅关注音频信号与 ASR 预测之间的关系。标注员被指示在识别幻觉时不依赖参考转录文本。
幻觉的定义为:
与 ASR 模型分析的音频信号内容没有语音对应关系的预测或其中的一部分。
标注员使用以下分类系统标记单词或短语:
- 幻觉:与录音中任何讲话内容不匹配的单词或短语。
- 循环:语音信号中存在的单词或短语的错误重复。
- 幻觉循环:本身是幻觉且与音频信号不匹配的内容的错误重复。
每个音频文件由两名标注员独立标注,分歧由第三名标注员仲裁解决。
除幻觉标注外,所有参考转录文本均经过人工审查并在必要时修正。在此过程中,约 14% 的样本被识别为部分听不清或含混不清。
生成的数据集包含:
- 人工标注的幻觉跨度
- 人工标注的循环跨度
- 人工标注的幻觉循环跨度
- 修正后的参考转录文本
- 语句级幻觉标签
- 多个 ASR 系统的预测结果
重要提示:HALAS 被有意构建为包含高比例的幻觉,因此不代表 ASR 幻觉在现实世界中的普遍性。然而,所有幻觉都源自真实的语音录音,而非人为损坏或非语音输入。
支持的任务
- 自动语音识别(ASR)
- 幻觉检测
- 幻觉缓解
- 错误检测
- 语音识别评估
- 语音处理研究
语言
- 英语
源录音来自财报电话录音,涵盖来自 27 个国家的讲话者。
许可协议
HALAS 衍生自 Earnings22 数据集,并通过人工生成的幻觉标注和修正后的参考转录文本对其进行增强。
原始 Earnings22 数据集在 Creative Commons Attribution-ShareAlike 4.0 International (CC BY-SA 4.0) 许可下公开分发。HALAS 的用户除了遵守本数据集指定的任何条件外,还必须遵守 Earnings22 许可的条款。完整许可文本见:
https://creativecommons.org/licenses/by-sa/4.0/
HALAS 包含作者制作的原始人工标注。除非官方仓库中另有规定,这些标注旨在与源数据集相同的许可下分发,以保持与底层 Earnings22 数据的兼容性。
注意:用户应查阅官方 HALAS 仓库以获取发布版本的权威许可条款。
数据集来源
- Hugging Face:https://huggingface.co/datasets/MatBar99/HALAS
- 论文:HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems,作者 Mateusz Barański, Jan Jasiński, Julitta Bartolewska, Marcin Witkowski, 和 Konrad Kowalczyk,已被 Interspeech 2026 录用。
数据字段
数据集包含以下字段:
| 字段 | 描述 |
|---|---|
audio_id |
来自 Earnings22 的音频片段唯一标识符 |
audio_duration |
音频片段的时长(秒) |
e22_reference_text |
Earnings22 提供的原始参考转录文本 |
corrected_reference_text |
人工修正后的参考转录文本 |
model_prediction |
对应模型生成的 ASR 预测 |
model_label |
语句级幻觉标签,指示是否存在幻觉 |
model_hallucination_text |
标注为幻觉的文本跨度 |
model_hallucination_json |
包含幻觉位置和类别的结构化跨度标注 |
split |
数据集拆分(train 或 test) |
model 字段对应以下 ASR 系统之一:
whisper_large_v2whisper_large_v3whisper_large_v3_turbocrisper_whispercanarycanary_flashparakeetphi4*granite*
标有星号(*)的模型不属于相关论文的范围,因为它们是在 Earnings22 数据集上训练的。
标注方法
- 标注员:10 名专业标注员,英语水平达到 B2 级或以上。
- 标注流程:
- 听取音频录音。
- 识别音频质量问题(例如:非英语语音、讲话者重叠、听不清片段)。
- 标注员在听取音频的同时审查 ASR 预测。
- 使用 HALAS 分类系统标记幻觉跨度。
- 第二名标注员独立重复该过程。
- 第三名标注员解决分歧并确定最终标注。
- 质量控制:每个样本由两名独立标注员审查。标注员间一致性较高,Cohens κ = 0.87。所有参考转录文本均由仲裁员重新验证和修正。
数据拆分
| 拆分 | 文件数 |
|---|---|
| 训练集 | 2,866 |
| 测试集 | 745 |
训练/测试拆分的创建方式:
- 按源会议拆分。
- 根据以下因素进行分层:
- 平均 WER
- 幻觉率
- 音频时长
为确保基准的稳定性,测试集仅包含:
- 时长超过 1 秒的录音
- 包含至少 3 个单词的录音
数据集统计:
| 拆分 | 幻觉率 |
|---|---|
| 训练集 | 33.6% |
| 测试集 | 22.6% |
数据集特征
- 源音频:来自 Earnings22 数据集——约 119 小时音频、财报电话录音、27 个国家讲话者、真实世界录音条件。
- 选择策略:从 ASR 系统间高度不一致的部分中选择候选片段。
- 代表性说明:HALAS 有意识地过度采样了困难的音频片段。因此,幻觉频率不代表真实部署条件,数据集偏向于导致 ASR 系统不一致的样本。
偏见、风险与局限
- 幻觉频率不反映现实部署条件。
- 数据集偏向于导致 ASR 系统不一致的音频样本。
- 在 HALAS 上获得的结果不应被解释为生产系统中幻觉普遍性的估计。
- 数据集专注于英文财报电话录音,可能无法泛化到其他领域、语言或声学环境。
- 部分音频样本包含口音、低质量录音或部分听不清的语音等挑战性条件。
- 尽管参考文本经过手动修正,某些录音由于音频质量差本质上仍然存在歧义。
研究人员应将 HALAS 主要视为幻觉检测和分析的基准,而非日常 ASR 使用的代表性样本。
建议
使用 HALAS 的研究人员应:
- 报告评估是在语句级还是跨度级进行的。
- 在解释结果时考虑有意提高的幻觉率。
- 将幻觉与普通转录错误区分开来。
- 同时考虑结构性和语义性评估指标。
- 尽可能在其他数据集上评估泛化能力。
由于 HALAS 包含来自真实语音录音的自然发生的幻觉,它提供了比由非语音或人为损坏音频构建的数据集更现实的基准。





