遇见数据集

XhotpotQA-V2

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

XHotpotQA V2 是一个跨语言多跳问答数据集,基于 HotpotQA 翻译扩展而来。该数据集旨在支持混合语言证据下的多跳问答研究,其中问题和答案使用指定语言,而候选段落可能包含多种语言。RC1 版本(Audited RC1)是候选发布版,包含 22,836 条已审核记录,覆盖 23,066 个预期 HotpotQA 源中的 99.003%,明确标注了 230 个缺失源。数据分为训练集(15,433 条)和验证集(7,403 条),涵盖 24 种语言(阿拉伯语、孟加拉语、德语、希腊语、英语、西班牙语、波斯语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、俄语、瑞典语、斯瓦希里语、泰语、土耳其语、乌尔都语、越南语、中文)。每条记录包含原始英文源问题与答案、翻译后的问答对、候选段落(含原文标题和句子)、支持事实、状态标志(accepted / review_required / quarantined)、结构标志、质量标志以及多条校验和。数据通过 Gemma 4 31B Instruct 模型生成,并附有独立 GLM-5.2 审计评分(段落 94.468,问题 96.009,答案 94.183)。该数据集适用于混合语言多跳 QA 研究、证据语言鲁棒性分析、阅读器/选择器诊断以及翻译质量评估。注意:RC1 版本不完整,缺失源已明确记录,使用时需参考状态字段和缺失清单。

XHotpotQA V2 is a cross-lingual multi-hop question answering dataset, extended from HotpotQA via translation. It is designed to support multi-hop QA research under mixed-language evidence, where questions and answers are in a specified language while candidate passages may contain multiple languages. The RC1 version (Audited RC1) is a candidate release containing 22,836 audited records, covering 99.003% of the 23,066 expected HotpotQA sources, with 230 missing sources explicitly noted. The data is split into training (15,433) and validation (7,403) sets, covering 24 languages (Arabic, Bengali, German, Greek, English, Spanish, Persian, French, Hindi, Indonesian, Italian, Japanese, Korean, Dutch, Polish, Portuguese, Russian, Swedish, Swahili, Thai, Turkish, Urdu, Vietnamese, Chinese). Each record includes original English source question and answer, translated question-answer pair, candidate passages (with original titles and sentences), supporting facts, status flags (accepted / review_required / quarantined), structure flags, quality flags, and multiple checksums. The data is generated using the Gemma 4 31B Instruct model and is accompanied by independent GLM-5.2 audit scores (passage 94.468, question 96.009, answer 94.183). The dataset is suitable for mixed-language multi-hop QA research, evidence language robustness analysis, reader/selector diagnostics, and translation quality assessment. Note: The RC1 version is incomplete; missing sources are explicitly recorded and users should refer to the status field and missing list when using.

创建时间:
2026-08-22
原始信息汇总

XHotpotQA V2 数据集详情

基本信息

  • 数据集名称: XHotpotQA V2
  • 状态: AUDITED RC1(审核候选版),非最终完整版
  • 许可证: CC BY-SA 4.0
  • 任务类型: 问答(question-answering)
  • 规模: 10K-100K 条记录
  • 覆盖语言: 阿拉伯语、孟加拉语、德语、希腊语、英语、西班牙语、波斯语、法语、印地语、印度尼西亚语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、俄语、瑞典语、斯瓦希里语、泰语、土耳其语、乌尔都语、越南语、中文

核心特性

  • 跨语言多跳问答: 问题和答案使用指定语言,候选段落可在同一实例内使用不同语言
  • 混合语言证据: 支持在推理过程中混合多种语言的证据段落
  • 源对齐字段: 提供英文源材料用于直接审计
  • 稳定标识: 保留了 HotpotQA 支持链的稳定段落和句子标识

数据规模与覆盖情况

数据划分 已发布 预期 缺失 覆盖率
训练集(HotpotQA hard) 15,433 15,661 228 98.544%
验证集(distractor) 7,403 7,405 2 99.973%
总计 22,836 23,066 230 99.003%

缺失记录已通过 MISSING_SOURCE_MANIFEST.json 明确列出,不会静默生成或隐藏缺失行。

数据集结构

记录字段

字段 含义
id 生成的 XHotpotQA 实例标识符
source_id, source_split, source_position 在固定的 HotpotQA 源中的稳定位置
question, answer 翻译后的问答对
question_language, answer_language 使用的 ISO 风格语言代码
source_question, source_answer 原始英文 HotpotQA 文本
candidates 有序翻译段落及原始标题和句子
supporting_facts 带源标题和边界检查的稳定段落/句子链接
status acceptedreview_requiredquarantined
structural_flags 确定性的结构/源对齐发现
quality_flags 确定性的审查信号(如源复制输出)
source_record_sha256 规范源记录的校验和
input_record_checksum_sha256 生成器提供的语义校验和
release_record_sha256 规范化公开行的校验和

候选段落结构

每个候选包含:paragraph_idcandidate_indexsource_titlesource_sentencestitlesentenceslanguagelanguage_namesource_match

状态与质量策略

  • accepted(已接受): 通过确定性检查,无内容级审查标志
  • review_required(需审查): 结构可用,但存在需要检查的自动质量信号
  • quarantined(隔离): 至少一项结构或源对齐条件失败

代表性结构性标志: 输入校验和不匹配、候选数量不匹配、源句子不匹配、句子数量不匹配、支持注释不匹配、空白源句子、支持索引超出范围

代表性质量标志: 问题源复制、答案源复制、段落句子源复制、分配清单哈希缺失

生成方法与溯源

  • 生成模型: Gemma 4 31B Instruct(通过 vLLM OpenAI 兼容 API 提供服务)
  • 提示版本: xhotpotqa-translation-v2.0
  • 提示 SHA-256: 623496d198d7850c244ff4e2303b7ba9b61548499ce10256ae6691a6b58e71f3
  • 种子: 20260810
  • 生成时间: 2026-08-12T20:55:00Z 至 2026-08-13T21:23:54Z
  • 温度设置: 22,379 条记录在温度 0.0 下生成,354 条重试记录在 0.2 下,103 条重试记录在 0.3 下

质量审计

独立 GLM-5.2 法官发布包含语言平衡的审计样本:

  • 段落翻译: 1,840 条,平均得分 94.468
  • 问题翻译: 460 条,平均得分 96.009
  • 答案翻译: 460 条,平均得分 94.183

使用限制

  • RC1 是不完整的发布候选版,不应描述为完整或修正的规范 V2
  • 内容源于英文维基百科(通过 HotpotQA),翻译不产生原生信息需求
  • 翻译和音译质量因语言、文字、实体类型和答案类型而异
  • 自动源复制标志需要上下文审查(名称或标题的精确复制可能是正确的)
  • 伴随的 LLM 法官是单一未校准的模型别名

预期用途

  • 混合语言多跳问答研究
  • 证据语言和文字鲁棒性分析
  • 具有稳定支持事实的阅读器和选择器诊断
  • 使用源对齐字段的翻译质量和溯源研究

引用信息

请引用 HotpotQA 和 XHotpotQA 论文/仓库。规范引用格式见原始 V1.1 数据集卡。在工件描述中,应报告数据集标识 Iman998/XhotpotQA-V2、配置 xhotpotqa_v2_audited_rc1、冻结修订版 b05ba394ad7312e85625624c90d10258cbab31af 以及不完整的 RC1 状态。

搜集汇总
数据集介绍
XhotpotQA-V2 数据集图片
构建方式
XHotpotQA-V2是基于HotpotQA源数据构建的跨语言多跳问答基准,通过Gemma 4 31B Instruct模型进行翻译生成。每条记录包含源语言问题与答案、分配的翻译语言、候选段落及其句子级翻译,并保留稳定的段落与句子标识以维持HotpotQA支持链。数据集以RC1候选版本发布,锁定22,836条记录(涵盖训练集15,433条与验证集7,403条),并明确列出230条缺失源,同时提供完整的源记录哈希、输入记录校验和与发布记录校验和,确保可追溯性与完整性验证。
特点
该数据集的核心特点在于其跨语言混合证据设计,同一实例中问题与答案使用一种指定语言,而候选段落可能包含不同语言,从而模拟真实世界中的多语言信息检索场景。每条记录附带丰富元数据,如源问题与答案、源标题与句子、语言代码、支持事实链接及行级结构/质量标志,便于进行来源对齐与质量审计。数据集特意标记为RC1非完整版本,缺失源以清单形式透明公开,并提供状态划分(accepted、review_required、quarantined),以支持细粒度的数据可信度评估。
使用方法
用户可通过HuggingFace datasets库加载指定修订版本(如b05ba394ad7312e85625624c90d10258cbab31af)以固定数据快照,配置名为xhotpotqa_v2_audited_rc1。加载后可按需访问字段,如问题、答案、语言、候选段落及源对齐信息。适用于跨语言多跳问答研究、证据语言鲁棒性分析、阅读器/选择器诊断及翻译质量与来源验证。使用时需注意行状态与缺失源清单,避免将非完整数据视为最终版本,并遵循CC BY-SA 4.0许可进行引用。
背景与挑战
背景概述
XHotpotQA-V2 是在多语言与跨语言问答研究领域持续演进的背景下,由研究者基于 HotpotQA 源数据构建的跨语言多跳问答基准。该数据集创建于2026年,其核心研究问题在于实现受控的跨语言多跳问答任务,其中问题和答案使用同一种语言,而候选段落可能使用不同语言,且需保持对源支持链的稳定引用。该资源由相关研究团队发布,利用 Gemma 4 31B Instruct 模型进行翻译生成,并引入严格的审计流程,旨在为多语言推理和混合语言证据分析提供可靠数据基础。在领域内,它的出现填补了跨语言多跳问答资源稀缺的空白,对促进多语言自然语言处理研究具有重要意义,尤其为验证模型在多语言环境下的推理能力和鲁棒性提供了宝贵工具。
当前挑战
该数据集当前面临多层面的挑战。首先,在领域问题层面,多语言多跳问答要求模型不仅具备跨语言理解能力,还需处理混合语言证据,这对模型的语言泛化能力和推理准确性构成显著挑战,且不同语言间的实体、数字和语义保持是难点。其次,在构建过程中面临严峻挑战:源数据存在缺失,如缺失230个预期源,以及空白句子或支持索引越界等异常;同时,翻译生成过程需确保高精度和一致性,但自动评估仍存局限,且当前RC1版本不完整,无法满足完整规范,需明确策略处理缺失数据和异常行,以保证数据质量和可靠性。
常用场景
经典使用场景
XHotpotQA-V2作为跨语言多跳问答领域的标杆性基准,其核心设计在于模拟真实世界中信息检索与推理所需的混合语言证据环境。该数据集精心构建了多语言问题与答案配对,并巧妙地在候选段落中混入不同语言的证据文本,旨在严苛检验模型在语言交错场景下的多跳推理能力。其经典使用范式聚焦于评估和提升跨语言阅读理解系统的鲁棒性,特别关注模型能否有效跨越语言障碍,依据分散于不同语种的线索进行逻辑串联与知识整合,从而达成对复杂问题的精准解答。
实际应用
在现实应用层面,XHotpotQA-V2所涵括的混合语言场景与多跳推理需求,直接映射至全球化信息服务中的关键挑战。它对于构建能够整合多源、多语种信息的智能问答系统具有直接的指导价值,例如跨国界知识图谱问答、多语言客服助手以及面向科研的跨语种文献综述工具。其提供的结构化支持事实与质量审计信息,亦为开发高可靠性的知识密集型应用奠定了坚实基础,促进了从实验室研究到产业界部署的技术转化与落地验证。
衍生相关工作
基于XHotpotQA-V2所确立的评估框架与数据特性,研究者已衍生出诸多富有成效的后续工作。这些工作涵盖了对多语言预训练模型的深度剖析,探究其在不同语言组合下的证据检索与推理短板;同时,该数据集也催生了针对多跳问答中证据去噪与重排序的专门算法研究。此外,源对齐的字段设计为分析翻译质量与推理性能的关联提供了独特视角,由此涌现了一批关于如何利用数据增强与对比学习来提升跨语言推理泛化能力的前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务