XhotpotQA
收藏资源简介:
XHotpotQA 是一个跨语言多跳问答数据集,旨在评估模型在问题、证据段落和干扰项使用不同语言时的证据选择与组合能力。它基于 HotpotQA 的 distractor 任务,通过机器翻译和众包方式将原始英文数据扩展至 24 种语言(包括阿拉伯语、孟加拉语、德语、希腊语、英语、西班牙语、波斯语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、俄语、瑞典语、斯瓦希里语、泰语、土耳其语、乌尔都语、越南语和中文)。数据集包含 23,066 个样本,其中训练集 15,661 个,验证集 7,405 个。每个样本包含一个多语言问题、对应的答案、一组有序的候选段落(包括两个黄金段落和多个干扰项,每个段落可能使用不同语言)、句子级别的支持事实标注、以及结构质量审计标志(如 accepted、review_required、quarantined)。数据以分片、Zstandard 压缩的 Parquet 格式存储,共 22 个字段,涵盖身份标识、QA 文本、证据、审计和来源追溯信息。该数据集适用于跨语言多跳问答、混合语言证据选择、支持事实识别等任务,原始数据及代码采用 CC-BY-SA-4.0 许可证,推荐使用 xhotpotqa_v1_1_audited 配置(包含原始英文句子)。
XHotpotQA is a cross-lingual multi-hop question answering dataset designed to evaluate the models ability to select and combine evidence when the question, evidence paragraphs, and distractors are in different languages. It is based on the distractor task of HotpotQA, extending the original English data to 24 languages (including Arabic, Bengali, German, Greek, English, Spanish, Persian, French, Hindi, Indonesian, Italian, Japanese, Korean, Dutch, Polish, Portuguese, Russian, Swedish, Swahili, Thai, Turkish, Urdu, Vietnamese, and Chinese) via machine translation and crowdsourcing. The dataset contains 23,066 samples, with 15,661 in the training set and 7,405 in the validation set. Each sample includes a multilingual question, corresponding answer, an ordered set of candidate paragraphs (including two gold paragraphs and multiple distractors, each paragraph may be in a different language), sentence-level supporting fact annotations, and structural quality audit flags (e.g., accepted, review_required, quarantined). The data is stored in sharded, Zstandard-compressed Parquet format, with 22 fields covering identity, QA text, evidence, audit, and provenance information. This dataset is suitable for tasks such as cross-lingual multi-hop QA, mixed-language evidence selection, and supporting fact identification. The original data and code are licensed under CC-BY-SA-4.0. The recommended configuration is xhotpotqa_v1_1_audited (including original English sentences).
XHotpotQA 数据集概述
基本信息
XHotpotQA 是一个跨语言多跳问答基准数据集,用于研究系统在面对问题、黄金段落和干扰项不一定使用相同语言时,如何选择和组合证据。该数据集将 HotpotQA distractor 任务适配到 24 种语言(阿拉伯语、孟加拉语、德语、希腊语、英语、西班牙语、波斯语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、俄语、瑞典语、斯瓦希里语、泰语、土耳其语、乌尔都语、越南语、中文)。
规模与版本
- 总数据量:23,066 行(训练集 15,661 行,验证集 7,405 行)
- 许可证:CC BY-SA 4.0
- 存储格式:分片的 Zstandard 压缩 Parquet 文件,包含 22 个字段
配置版本
| 配置名 | 说明 |
|---|---|
xhotpotqa_v1_1_audited(默认) |
保留 V1 审计翻译,并添加原始英文候选段落为 source_sentences |
xhotpotqa_v1_audited(冻结版本) |
用于精确复现早期实验,数据保持不变 |
核心特点
实例内语言混合
- 问题和答案共享一种指定语言
- 每个候选段落有独立的指定语言
- 两个黄金段落可以与问题语言对齐、部分不匹配或完全多语言不匹配
- 多语言干扰项对证据选择系统保持可见
任务设计
- 任务类型:提供的候选跨语言多跳问答
- 监督信号:答案 + 句子级支持事实
- 评估目标:在语言不匹配下衡量证据选择和答案组合能力,不涉及开放语料检索
数据结构
主要字段族
| 字段族 | 核心字段 | 用途 |
|---|---|---|
| 身份标识 | id, source_id, source_*_position |
稳定身份和源/发布对齐 |
| 问答 | question, answer, 源文本, 语言字段 |
翻译任务及原始参考文本 |
| 证据 | candidates[], supporting_facts[] |
有序段落和句子级监督 |
| 审计 | status, structural_flags[], record_sha256 |
非破坏性质量发现和完整性 |
| 来源追踪 | provenance.* |
可追溯的源→分片→发布构建 |
状态标签说明
accepted:接受review_required:需审查quarantined:隔离(数据质量标签,但不排除数据,行仍保留在发布的分割中)
使用建议
- 复现冻结基准:使用完整验证集(7,405 行)
- 复现论文中的 439 项排除分析:使用
status != "quarantined"(6,966 行) - 严格接受视图:
status == "accepted"(6,962 行,需单独标注)
发布状态
- 可用:审计 V1.1 版本,包含原始英文段落句子
- 未发布:XHotpotQA+ 完整并行验证映射不可用
- 公开 RC1:V2 候选版本覆盖 22,836/23,066 行,不完整,非规范 V2
数据下载
可通过 Hugging Face datasets 库加载,建议固定版本号 1d29e7918cf1acc045726c70fddba82371833090,支持流式加载以节省内存。




