遇见数据集

hat

收藏
Hugging Face2026-07-08 更新2026-07-10 收录
官方服务:

资源简介:

HAT(Hallucination Annotation for Translation)是一个用于机器翻译幻觉检测的大规模数据集。该数据集旨在促进机器翻译系统中幻觉(即流畅但不忠实于源内容输出)的检测与缓解研究。数据集包含350,959个跨度级标注样本,覆盖38个语言对,每个语言对包含约8,000-10,000个样本,并划分为训练集、开发集和测试集。数据创建过程包括从网络收集单语数据、使用强神经机器翻译模型进行翻译、基于质量指标选择可能包含幻觉的低质量翻译样本,最后由专业译员在严格质量控制下进行标注。数据以Parquet格式存储,每个样本包含源语言区域(source_locale)、源文本(source_text)、目标语言区域(target_locale)、机器翻译输出(target_text)、数据集划分(split)、二元幻觉标签(label,0表示无幻觉,1表示包含幻觉)、幻觉字符比例分数(score)以及原始的跨度级标注(annotation)。该数据集适用于机器翻译、文本分类(幻觉检测)和机器翻译评估等任务。

HAT (Hallucination Annotation for Translation) is a large-scale dataset for machine translation hallucination detection. The dataset aims to facilitate research on detecting and mitigating hallucinations (i.e., fluent but unfaithful outputs to the source content) in machine translation systems. It contains 350,959 span-level annotated samples, covering 38 language pairs, with approximately 8,000-10,000 samples per language pair, and is divided into training, development, and test sets. The data creation process involves collecting monolingual data from the web, translating it using strong neural machine translation models, selecting low-quality translation samples that may contain hallucinations based on quality metrics, and finally annotating them by professional translators under strict quality control. The data is stored in Parquet format, with each sample including source locale, source text, target locale, machine translation output (target text), dataset split, binary hallucination label (label, where 0 indicates no hallucination and 1 indicates hallucination), hallucination character ratio score (score), and original span-level annotation (annotation). The dataset is suitable for tasks such as machine translation, text classification (hallucination detection), and machine translation evaluation.

提供机构:
Apple
创建时间:
2026-07-08
原始信息汇总

数据集名称

HAT: Hallucination Annotation for Translation

数据集概述

HAT是一个用于机器翻译(MT)幻觉检测的大规模数据集,由苹果公司发布,并作为ACL 2026论文的一部分。数据集包含350,959个经过跨度级别标注的样本,覆盖38个语言对,每个语言对约有8,000-10,000个样本,并划分为训练集、验证集和测试集。标注工作由专业翻译人员在严格质量控制下完成。

数据集结构

  • 配置: 提供一个默认配置(合并所有语言对)和38个语言对配置(如en_US-ja_JPfr_FR-en_US等)。
  • 划分: 每个配置包含trainvalidationtest三个划分。
  • 数据格式: Parquet格式,位于data/目录下,按train/dev/test/子目录组织,每个语言对对应一个子文件夹。
  • 模式(Schema):
    字段 类型 描述
    source_locale string 源文本的区域设置
    source_text string 源句子
    target_locale string 目标文本的区域设置
    target_text string 机器翻译输出
    split string 数据集划分(train/dev/test)
    label int64 二值幻觉标签(0: 无幻觉,1: 有幻觉)
    score float64 幻觉字符的比例(0-1)
    annotation string 原始跨度级别的幻觉标注

数据统计

划分 每个语言对的样本数
训练集 约10,000
开发集 约2,000
测试集 约3,000

语言覆盖

数据集包含38个语言对,涉及以下语言(以区域设置表示):

  • 源语言或目标语言:ar(阿拉伯语)、nl(荷兰语)、en(英语)、fr(法语)、de(德语)、hi(印地语)、id(印度尼西亚语)、it(意大利语)、ja(日语)、ko(韩语)、pl(波兰语)、pt(葡萄牙语)、ru(俄语)、zh(中文)、es(西班牙语)、th(泰语)、tr(土耳其语)、uk(乌克兰语)、vi(越南语)

具体语言对包括英语与上述语言的互译方向,以及部分非英语语言对(如ar_AE-en_USde_DE-en_US等)。

任务类别

  • 翻译
  • 文本分类(幻觉检测)

标签

  • 机器翻译
  • 幻觉检测
  • MT评估

许可协议

CC BY-NC-ND 4.0(Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International)

创建流程

  1. 数据收集: 从网络抓取每种语言约500万句子,经过语言识别、长度过滤和去重。
  2. 翻译: 使用强大的神经机器翻译模型将单语句子翻译成目标语言。
  3. 样本选择: 基于质量指标选择质量较低的翻译,以增加幻觉出现的可能性。
  4. 标注: 专业翻译人员在严格质量控制下标注幻觉。
  5. 后处理: 移除源文本有问题的样本,确保数据完整性。

引用

bibtex @inproceedings{chatterjee-etal-2026-hat, title = "{HAT}: Hallucination Annotation for Translation", author = "Chatterjee, Rajen and Li, Xintong and Charoenpornsawat, Paisarn and Lee, Allen", editor = "Liakata, Maria and Moreira, Viviane P. and Zhang, Jiajun and Jurgens, David", booktitle = "Proceedings of the 64th Annual Meeting of the {A}ssociation for {C}omputational {L}inguistics (Volume 1: Long Papers)", month = jul, year = "2026", address = "San Diego, California, United States", publisher = "Association for Computational Linguistics", url = "https://aclanthology.org/2026.acl-long.721/", pages = "15865--15888", ISBN = "979-8-89176-390-6", }

搜集汇总
数据集介绍
hat 数据集图片
构建方式
HAT数据集的构建始于大规模网页语料采集,经语言识别、长度筛选与去重处理,最终获取约500万句每语言的原始文本。随后采用高性能神经机器翻译模型将单语语料翻译为目标语言,并依据质量评估指标筛选出翻译质量较低的样本,以提升包含幻觉内容的概率。专业译员在严格质控流程下对候选样本进行逐句标注,精确定位幻觉片段,最后经后处理移除源端存在问题的数据,确保整体数据完整性。
特点
该数据集涵盖38个语言方向,总计350,959条片段级标注样本,是迄今规模最大的机器翻译幻觉检测专用资源。每个语言方向均包含约10,000条训练、2,000条验证及3,000条测试样本,结构均衡。标注由职业译员完成,质量控制严格,提供二进制幻觉标签(是否含幻觉)、0到1的幻觉字符比例分数以及原始的片段级标注文本,为幻觉检测研究提供了多维度、高可靠的评估基础。
使用方法
研究人员可通过Hugging Face Datasets库便捷加载该数据集。调用load_dataset('apple/hat')将加载全部38个语言对,而指定配置名如'en_US-ja_JP'则可获取单一语言方向的子集。每个配置都包含train、validation和test三个划分。数据集以Parquet格式存储,每条记录包含源语言、源文本、目标语言、目标文本、划分归属、幻觉标签、幻觉分数及标注详情等字段,便于直接用于分类模型训练或评估。
背景与挑战
背景概述
在机器翻译领域,幻觉现象——即模型生成流畅但偏离源文语义的译文——已成为制约其可靠部署的核心瓶颈。尽管学术界对该问题日益关注,但大规模、高质量的专用检测基准长期匮乏。为此,Rajen Chatterjee、Xintong Li、Paisarn Charoenpornsawat和Allen Lee等研究者于2026年推出了HAT(Hallucination Annotation for Translation)数据集,该成果发表于ACL 2026主会。HAT由Apple团队构建,涵盖350,959条经过专业翻译员严格质量控制的细粒度标注样本,覆盖38个语言对,每个语言对约8,000-10,000条样本,划分为训练、验证和测试集。作为首个大规模、系统化标注的机器翻译幻觉检测资源,HAT为衡量译文忠实度提供了标准化测试平台,推动了更可靠翻译系统的研发。
当前挑战
HAT所解决的核心领域问题是机器翻译的幻觉检测,其挑战在于:幻觉译文虽在局部流畅却整体偏离源文,传统自动评估指标难以精准识别此类语义脱节,而现有标注数据规模小、语言覆盖窄,无法支撑鲁棒检测模型的训练。在数据集构建过程中,团队面临多项难题:首先,从互联网爬取约500万句/语言的单语数据后,需经语言识别、长度过滤及去重以保障质量;其次,利用强神经机器翻译模型生成译文并基于质量指标筛选低分样本以提升幻觉比例;最后,依赖专业翻译员进行细粒度标注,需建立严格的质控流程,并剔除源文存在问题的样本,以确保标注的一致性与数据完整性。
常用场景
经典使用场景
在机器翻译领域,HAT数据集被广泛用于训练和评估幻觉检测模型。研究者利用其提供的35万余条细粒度标注样本,覆盖38个语言方向,以构建能够识别翻译输出中与源文语义偏离内容的分类器。该数据集的经典使用方式是将源文与机器翻译结果作为输入,通过监督学习训练二元分类模型,以判断翻译是否包含幻觉成分。此外,其提供的字符级别标注信息也支持序列标注任务的探索,从而实现更精准的幻觉定位与量化分析。
解决学术问题
HAT数据集的核心学术贡献在于填补了机器翻译幻觉检测领域缺乏大规模高质量基准的空白。此前,由于缺少系统性的标注资源,研究者难以有效评估和对比不同幻觉检测方法的性能。该数据集通过严格专业翻译人员标注和标准化流程,为幻觉检测提供了可靠的训练与测试基础,从而推动了从传统质量评估指标到大型语言模型等多样化基线方法的系统性研究。这些研究不仅加深了对幻觉产生机制的理解,也为构建更忠实的翻译系统奠定了理论和实验基础。
衍生相关工作
自HAT数据集发布以来,多项衍生工作围绕其展开。研究者将其作为基准评估幻觉检测的新方法,包括基于大语言模型的零样本与少样本提示策略,以及结合对比学习的表征增强技术。一些工作在此基础上扩展了语言对覆盖范围或引入多模态翻译场景下的幻觉检测。该数据集还激发了针对幻觉根源的归因分析研究,例如通过探索源文噪声与模型解码策略如何共同诱发幻觉,并进而催生了可控文本生成中幻觉缓解策略的探索,为构建更鲁棒的对话与翻译系统提供了方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务