遇见数据集

XhotpotQA

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

XHotpotQA 是一个跨语言多跳问答数据集,旨在评估模型在问题、证据段落和干扰项使用不同语言时的证据选择与组合能力。它基于 HotpotQA 的 distractor 任务,通过机器翻译和众包方式将原始英文数据扩展至 24 种语言(包括阿拉伯语、孟加拉语、德语、希腊语、英语、西班牙语、波斯语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、俄语、瑞典语、斯瓦希里语、泰语、土耳其语、乌尔都语、越南语和中文)。数据集包含 23,066 个样本,其中训练集 15,661 个,验证集 7,405 个。每个样本包含一个多语言问题、对应的答案、一组有序的候选段落(包括两个黄金段落和多个干扰项,每个段落可能使用不同语言)、句子级别的支持事实标注、以及结构质量审计标志(如 accepted、review_required、quarantined)。数据以分片、Zstandard 压缩的 Parquet 格式存储,共 22 个字段,涵盖身份标识、QA 文本、证据、审计和来源追溯信息。该数据集适用于跨语言多跳问答、混合语言证据选择、支持事实识别等任务,原始数据及代码采用 CC-BY-SA-4.0 许可证,推荐使用 xhotpotqa_v1_1_audited 配置(包含原始英文句子)。

XHotpotQA is a cross-lingual multi-hop question answering dataset designed to evaluate the models ability to select and combine evidence when the question, evidence paragraphs, and distractors are in different languages. It is based on the distractor task of HotpotQA, extending the original English data to 24 languages (including Arabic, Bengali, German, Greek, English, Spanish, Persian, French, Hindi, Indonesian, Italian, Japanese, Korean, Dutch, Polish, Portuguese, Russian, Swedish, Swahili, Thai, Turkish, Urdu, Vietnamese, and Chinese) via machine translation and crowdsourcing. The dataset contains 23,066 samples, with 15,661 in the training set and 7,405 in the validation set. Each sample includes a multilingual question, corresponding answer, an ordered set of candidate paragraphs (including two gold paragraphs and multiple distractors, each paragraph may be in a different language), sentence-level supporting fact annotations, and structural quality audit flags (e.g., accepted, review_required, quarantined). The data is stored in sharded, Zstandard-compressed Parquet format, with 22 fields covering identity, QA text, evidence, audit, and provenance information. This dataset is suitable for tasks such as cross-lingual multi-hop QA, mixed-language evidence selection, and supporting fact identification. The original data and code are licensed under CC-BY-SA-4.0. The recommended configuration is xhotpotqa_v1_1_audited (including original English sentences).

创建时间:
2026-08-11
原始信息汇总

XHotpotQA 数据集概述

基本信息

XHotpotQA 是一个跨语言多跳问答基准数据集,用于研究系统在面对问题、黄金段落和干扰项不一定使用相同语言时,如何选择和组合证据。该数据集将 HotpotQA distractor 任务适配到 24 种语言(阿拉伯语、孟加拉语、德语、希腊语、英语、西班牙语、波斯语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、俄语、瑞典语、斯瓦希里语、泰语、土耳其语、乌尔都语、越南语、中文)。

规模与版本

  • 总数据量:23,066 行(训练集 15,661 行,验证集 7,405 行)
  • 许可证:CC BY-SA 4.0
  • 存储格式:分片的 Zstandard 压缩 Parquet 文件,包含 22 个字段

配置版本

配置名 说明
xhotpotqa_v1_1_audited(默认) 保留 V1 审计翻译,并添加原始英文候选段落为 source_sentences
xhotpotqa_v1_audited(冻结版本) 用于精确复现早期实验,数据保持不变

核心特点

实例内语言混合

  • 问题和答案共享一种指定语言
  • 每个候选段落有独立的指定语言
  • 两个黄金段落可以与问题语言对齐、部分不匹配或完全多语言不匹配
  • 多语言干扰项对证据选择系统保持可见

任务设计

  • 任务类型:提供的候选跨语言多跳问答
  • 监督信号:答案 + 句子级支持事实
  • 评估目标:在语言不匹配下衡量证据选择和答案组合能力,不涉及开放语料检索

数据结构

主要字段族

字段族 核心字段 用途
身份标识 id, source_id, source_*_position 稳定身份和源/发布对齐
问答 question, answer, 源文本, 语言字段 翻译任务及原始参考文本
证据 candidates[], supporting_facts[] 有序段落和句子级监督
审计 status, structural_flags[], record_sha256 非破坏性质量发现和完整性
来源追踪 provenance.* 可追溯的源→分片→发布构建

状态标签说明

  • accepted:接受
  • review_required:需审查
  • quarantined:隔离(数据质量标签,但不排除数据,行仍保留在发布的分割中)

使用建议

  • 复现冻结基准:使用完整验证集(7,405 行)
  • 复现论文中的 439 项排除分析:使用 status != "quarantined"(6,966 行)
  • 严格接受视图:status == "accepted"(6,962 行,需单独标注)

发布状态

  • 可用:审计 V1.1 版本,包含原始英文段落句子
  • 未发布:XHotpotQA+ 完整并行验证映射不可用
  • 公开 RC1:V2 候选版本覆盖 22,836/23,066 行,不完整,非规范 V2

数据下载

可通过 Hugging Face datasets 库加载,建议固定版本号 1d29e7918cf1acc045726c70fddba82371833090,支持流式加载以节省内存。

搜集汇总
数据集介绍
XhotpotQA 数据集图片
构建方式
XHotpotQA是在HotpotQA的distractor任务基础上构建的跨语言多跳问答基准数据集,覆盖24种语言。其构建方式为:从HotpotQA的hard难度训练集和完整distractor验证集中选取样本,将问题、答案及候选段落分别翻译并赋予语言标签,保留原始段落顺序、句子数组、元数据及支持事实标注,同时显式标记与源数据的结构偏差。数据提供两个配置:默认的xhotpotqa_v1_1_audited包含原始英文候选段落以方便段落级检查,而冻结的xhotpotqa_v1_audited则用于精确复现先前实验。所有符合条件的源样本均被保留,包括结构缺陷样本,并通过状态字段和结构标记进行机器可读的记录。
使用方法
使用者可通过datasets库加载数据集,推荐使用默认配置xhotpotqa_v1_1_audited并固定revision参数以确保可复现性。加载后可根据需求过滤状态,如排除'quarantined'样本以获得更干净的子集,或仅使用'accepted'样本进行严格评估。数据集提供训练集15661条和验证集7405条,验证集应作为主要评估基准。由于数据以Parquet格式分片存储,支持流式读取以进行低内存预览。使用时需注意报告评估的样本基数,避免混淆不同过滤条件下的结果,并务必存档使用的manifest文件以验证数据完整性。
背景与挑战
背景概述
XHotpotQA数据集于2023年由多语言自然语言处理领域的国际研究团队创建,其核心研究问题在于探索跨语言多跳问答中证据选择与组合的复杂机制。该数据集基于HotpotQA的distractor任务范式,将原始英文问答对扩展至24种语言,并创新性地引入了语言在问题、支持段落和干扰段落之间的混合分布,旨在揭示多语言环境下推理链条的断裂与重建规律。作为首个采用供给候选集、保留句子级支持事实标注的跨语言多跳问答基准,XHotpotQA填补了该领域在受控条件下评估证据混合语言能力的空白,为后续研究提供了可复现的评测平台,促进了多语言推理系统从单语向量检索向跨语言语义组合演进的学术对话。
当前挑战
该数据集面临的领域挑战在于,传统多语言问答系统多假设证据与问题语言一致,而XHotpotQA则要求在候选段落间语言随机切换的情况下,模型必须同时处理证据选择、跨语言对齐与推理路径构建,这显著增加了语义异质性带来的噪声干扰。在构建层面,数据集经历了翻译质量控制的严峻考验:由于采用机器翻译与人工审核相结合的方式,需对24种语言的译文逐一核验其结构保真度,并处理因语法差异导致的句子边界偏移、标题碰撞等结构缺陷。此外,设计者坚持保留包含疑似缺陷的样本,并引入状态标记与结构标志字段,以透明化质量审计过程,这要求在数据清洗与完整性保护之间寻求平衡,确保发布版本既反映真实分布又具备可追溯性,为后续纠正性V2版本的开发奠定了方法论基础。
常用场景
经典使用场景
XHotpotQA作为跨语言多跳问答的受控基准,其经典使用场景聚焦于评测模型在问题、证据段落与干扰项语言不一致时的证据选择与答案合成能力。该数据集保留了HotpotQA的候选段落结构,并独立标注各要素的语言归属,使得研究者能够精确控制语言错配的程度,从而剖析多跳推理中语言转换对性能的影响。典型任务要求模型依据给定候选集,跨越不同语言的桥梁信息,最终以问题语言返回答案,适用于检验多语言预训练模型的跨语言泛化与推理鲁棒性。
解决学术问题
该数据集解决了跨语言多跳问答研究中缺乏可控实验基准的突出问题。传统多语言QA数据集通常保持单语一致性,难以揭示语言错配导致的推理退化现象。XHotpotQA通过系统性地构造问题、证据及干扰项之间的语言分歧,为量化分析语言转换对证据组合和事实推理的干扰提供了标准化的评测平台。其细粒度的语言角色标注和结构化审计信息,推动了领域内对跨语言语义对齐、多跳证据选择策略以及多语言模型泛化能力的深入探究。
实际应用
在实际应用层面,XHotpotQA适用于开发与评估多语言智能问答系统,特别是在新闻聚合、跨语种信息检索及多语言客服等场景中,用户提问语言与后台文档语言不完全一致的情况极为常见。该数据集为验证系统能否在混合语言证据中准确筛选关键信息并生成高质量答案提供了可靠测试床。其审计版本支持细粒度的质量筛选,便于开发者对模型进行针对性调优,从而提升实际部署中面对语言混杂环境的鲁棒性。
数据集最近研究
最新研究方向
跨语言多跳问答的前沿探索正聚焦于混合语言证据下的推理鲁棒性,XHotpotQA作为该领域的里程碑式基准,通过构建问题、证据与干扰项语言角色错位的受控环境,系统性地挑战了多语言模型在证据选择与组合推理上的能力边界。其精细的句子级支持事实标注与结构化审计字段,为剖析模型在不同语言跳转中的信息整合机制提供了前所未见的粒度,催生了针对语言混杂场景的鲁棒性诊断、少样本跨语言泛化及多语种推理可解释性等热点方向。该数据集强调的混合语言证据场景,精准呼应了现实世界中全球化信息检索的复杂需求,不仅为评估多语言预训练模型的跨语言迁移能力设立了更高标杆,也推动了多跳问答从单语评估向真实多语动态环境的范式转移。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务