遇见数据集

XhotpotQA-GLM52-Judge-V1

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

XHotpotQA GLM-5.2翻译判断数据集V1是一个用于跨语言多跳问答翻译质量审计的标注数据集。该数据集包含2,760个评分单元,覆盖23种语言(阿拉伯语、孟加拉语、德语、希腊语、西班牙语、波斯语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、俄语、瑞典语、斯瓦希里语、泰语、土耳其语、乌尔都语、越南语、中文普通话)。每个单元由GLM-5.2大语言模型作为裁判,对从XHotpotQA数据集中提取的英文源文本(段落、问题或简短答案)的翻译进行0-100分的评分。数据集采用语言平衡的确定性抽样策略,每语言包含120个单元(80个段落、20个问题、20个答案)。评分基于忠实度(60%)、术语/实体/数字(15%)、流畅度(20%)和风格/语域(5%)的加权准则,并设有关键错误下限。该审计快照为V1版本,与独立的V2版本为无配对比较设计。公开架构包含judge_record_id、instance_id、target_language、unit、score等21个字段,但不包含源文本或候选译文内容,仅提供SHA-256哈希用于验证连接。数据集的加权平均得分为92.097,各单元和语言层级的详细结果在数据集中以表格形式提供。该数据集适用于研究LLM作为翻译裁判的可靠性、跨语言翻译质量评估以及多跳QA系统的翻译效果分析。

XHotpotQA GLM-5.2 Translation Judgment Dataset V1 is an annotated dataset for auditing translation quality in cross-lingual multi-hop QA. It contains 2,760 scoring units covering 23 languages (Arabic, Bengali, German, Greek, Spanish, Persian, French, Hindi, Indonesian, Italian, Japanese, Korean, Dutch, Polish, Portuguese, Russian, Swedish, Swahili, Thai, Turkish, Urdu, Vietnamese, Mandarin Chinese). Each unit is scored by the GLM-5.2 large language model on a 0-100 scale for translations of English source texts (paragraphs, questions, or short answers) extracted from the XHotpotQA dataset. The dataset uses a language-balanced deterministic sampling strategy, with 120 units per language (80 paragraphs, 20 questions, 20 answers). Scoring is based on weighted criteria: fidelity (60%), terminology/entities/numbers (15%), fluency (20%), and style/register (5%), with a critical error floor. This snapshot is V1, designed for unpaired comparison with the independent V2 version. The public schema includes 21 fields such as judge_record_id, instance_id, target_language, unit, score, etc., but does not include source text or candidate translations, only SHA-256 hashes for verification. The weighted average score is 92.097, with detailed results at unit and language levels provided in tables. The dataset is suitable for studying the reliability of LLMs as translation judges, cross-lingual translation quality assessment, and translation effect analysis of multi-hop QA systems.

创建时间:
2026-08-22
原始信息汇总

XHotpotQA GLM-5.2 翻译质量审计数据集(V1)

数据集概述

这是 XHotpotQA 资源分析中使用的 V1 翻译质量审计数据集,包含 2,760 条由 LLM(请求模型别名为 glm-5.2)生成的审计标注,对翻译质量进行 0-100 分评分。数据集不包含 QA 系统预测结果或人工黄金标签,而是聚焦于翻译质量的独立审计。公共数据已去除隐藏推理过程和原始文本,通过稳定的 XHotpotQA 标识符及 UTF-8 SHA-256 哈希实现可复现连接。

数据集规模与结构

  • 审计单元总数: 2,760 条,全部成功评分(100%)
  • 目标语言: 23 种,采用均衡抽样
  • 单元类型分布(每种语言):
    • 段落: 80 条(总计 1,840)
    • 问题: 20 条(总计 460)
    • 答案: 20 条(总计 460)
  • 加权平均分: 92.097(0-100 评分尺度)
  • 抽样种子: 20260810
  • 数据来源: 训练集衍生 1,866 条,验证集衍生 894 条

评分结果

按单元类型统计

单元 数量 均值 中位数 标准差 <60 <80 ≥90
段落 1,840 90.913 94 9.47 24 182 1,358
问题 460 93.459 96 10.71 12 35 387
答案 460 95.474 100 14.47 21 28 416

各语言总体均分(节选)

  • 最高: 葡萄牙语 95.87、西班牙语 95.39、意大利语 95.31
  • 最低: 土耳其语 89.18、斯瓦希里语 89.38、瑞典语 89.90

数据字段说明

主要字段包括:

  • judge_record_id: 版本与单元的确定性哈希
  • instance_id, source_id, source_split: 稳定数据集标识符
  • target_language, unit, paragraph_id: 审计层级与单元标识
  • score: 0-100 整数评分
  • score_origin: 评分来源解析
  • judge_explanation: 可视短解释(若有)
  • source_text_sha256, candidate_text_sha256: 精确连接验证哈希
  • requested_judge_model: 请求的模型别名(glm-5.2
  • resolved_judge_revision: 为空(提供方解析的模型修订版未记录)
  • judge_prompt_version, judge_prompt_sha256: 评分合约标识符

注意: 数据集中不包含 source_textcandidate_text、隐藏推理内容、端点 URL、请求错误、API 密钥或原始日志。

模型溯源

设置
请求模型字符串 glm-5.2
提供方解析修订版 未记录
温度 0.0
种子 20260810
最大输出 token 4,000
并发工作数 1
最终完成数 2,760 / 2,760

身份状态标记为 requested_alias_only_provider_revision_not_recorded,表明模型别名解析的检查点无法验证。

评分来源分布

来源 行数
显式 SCORE: 2,746
推理回退中的显式评分 4
最后整数推理回退 10

方法论与抽样设计

  • 抽样为确定性且覆盖 23 种目标语言
  • 段落源文本从固定的英文 HotpotQA 上下文中恢复;问题和答案来源来自原始英文字段
  • 与固定版本的 XHotpotQA V1.1 数据集通过 instance_id, unit, paragraph_id 连接,并使用 SHA-256 哈希验证字符串
  • V1 与 V2 审计独立抽取、非配对,均值差异不能解释为实例级或因果性的 V2 改进估计

局限性

  • 单一 LLM 评判不能替代双语人工标注或标注者间一致性验证
  • 提供方解析的模型版本及服务器配置不可用
  • 温度为零和种子设置不能保证第三方端点行为的确定性
  • 评分解析器历史上允许整数回退,score_origin 字段使这些情况透明可见
  • 评分标准对不同语言和实体类型可能应用转写预期不均
  • 样本均衡设计,但并非所有翻译的全量普查

许可证与引用

  • 许可证: CC BY-SA 4.0(衍生自 HotpotQA/XHotpotQA 内容)
  • 配套构建软件: MIT 许可证
  • 论文: arXiv:2608.27481,DOI: 10.48550/arXiv.2608.27481
  • 固定版本: 公共注释负载冻结于 Hub 修订版 ba891ae62ed989606c9fc2fd5f08f9e88ef37547
  • 相关资源:
    • 代码库: https://github.com/Iman998/XhotpotQA
    • 数据集合集: https://huggingface.co/collections/Iman998/xhotpotqa-cross-lingual-multi-hop-qa-6a888df6aee4a4f5612c3a1a
    • 源数据集: https://huggingface.co/datasets/Iman998/XhotpotQA
搜集汇总
数据集介绍
XhotpotQA-GLM52-Judge-V1 数据集图片
构建方式
该数据集源自XHotpotQA跨语言多跳问答资源,由GLM-5.2模型作为评判者,对23种目标语言的段落、问题及短答案的翻译质量进行0至100分的量化评估。构建过程采用确定性平衡采样,每语言各抽取段落80条、问题20条、答案20条,共计2760个评估单元。所有样本均基于固定种子的随机策略独立抽取,并附带详细的评分理由(部分隐藏)及用于验证的SHA-256哈希值,确保数据来源的可靠性和可复现性。
特点
数据集的核心特点在于其独立且非配对的审计设计,以及公开的、经过净化处理的注释信息。每个评估单元均包含明确的评分、来源标识(如源文本哈希)和评判模型的别名标识,且所有记录均经过审核,确保无遗漏。数据集的统计结果(如加权平均分92.097)及按语言和单元类型细分的得分分布,为跨语言翻译质量研究提供了全面的参考基准。此外,数据集的哈希锁定机制保障了数据版本的稳定性,便于后续研究的精确追溯。
使用方法
使用者可通过HuggingFace的load_dataset接口,并指定配置名'xhotpotqa_glm52_judge_v1'及冻结的修订版本号,轻松加载全部2760条审计记录。每条记录可依据instance_id、unit及paragraph_id字段与XHotpotQA V1.1主数据集进行精确连接,并通过SHA-256哈希验证文本的匹配性。该数据集适用于翻译质量评估、跨语言问答系统性能分析及多语言模型对比研究,同时为LLM-as-a-judge方法论提供丰富的实证素材。
背景与挑战
背景概述
XHotpotQA-GLM52-Judge-V1数据集于2026年由Iman研究团队构建,旨在评估GPT系列模型在跨语言多跳问答任务中的翻译质量。该数据集基于XHotpotQA,覆盖23种语言,包含2760个评分单元,利用GLM-5.2作为裁判模型,对段落、问题和答案的翻译进行0-100分的评分。其核心研究问题在于探索大语言模型作为翻译质量评估器的可靠性与一致性,填补了多语言复杂问答场景中自动评估的空白。该数据集采用独立非配对采样设计,强调审计的公正性,为跨语言自然语言处理提供了标准化评估基准,对后续研究具有重要参考价值。
当前挑战
该数据集面临的挑战包括多个层面。首先,在领域问题层面,多语言翻译质量评估本身具有复杂性,尤其是在多跳问答中,翻译错误可能导致事实性信息(如数字、实体)的丢失或扭曲,影响下游任务的准确性。其次,构建过程中面临模型判决的可信度问题:单一LLM裁判无法替代人工注释,且温度为零和固定种子无法保证第三方接口的确定性,导致评估结果可能不稳定。此外,数据集的样本虽经过平衡抽样,但并非全量普查,可能无法完全代表所有翻译场景。同时,源文本哈希未在原始运行中持久化,影响追溯验证的严谨性。这些挑战限制了数据集的普适性,并提示了在应用时需谨慎解释结果。
常用场景
经典使用场景
XHotpotQA-GLM52-Judge-V1作为跨语言多跳问答数据集XHotpotQA的翻译质量审计快照,其经典使用场景聚焦于利用大语言模型作为裁判(LLM-as-a-Judge)对机器翻译输出进行细粒度评分。该数据集覆盖23种目标语言,包含段落、问题与短答案三类单元的2,760条评分记录,每条记录均附带0-100分的整数评分及SHA-256哈希校验,为研究者提供了可复现的翻译质量评估基准。其设计强调语言平衡与独立采样,使得研究者能够系统性地衡量不同语言对上的翻译忠实度、术语准确性、流畅度及风格得体性,尤其适用于跨语言信息检索与问答系统的质量监控。
衍生相关工作
该数据集衍生的相关经典工作包括基于其评分数据训练的翻译质量预估模型,探索从浅层特征到深度语义的映射以替代在线评测;以及跨语言问答系统中的鲁棒性增强研究,利用审计结果识别高错误率语言并针对性扩充训练数据。此外,其独立采样与哈希校验设计启发了后续关于LLM裁判可复现性的研究,推动了评分协议标准化与偏见缓解策略的开发。该数据集的发布还促进了多语言翻译评测基准的整合,催生了一批关于多跳推理与翻译协同优化的进阶工作,为构建真正跨语境的智能问答体系奠定了实证基础。
数据集最近研究
最新研究方向
该数据集聚焦于跨语言多跳问答场景下的机器翻译质量自动评估,创新性地采用大语言模型作为裁判(LLM-as-a-judge)对23种目标语言的段落、问题及简短答案进行0-100分的细粒度评分。其研究前沿体现在对GLM-5.2模型在翻译忠实度、术语准确性、流畅性及风格保持等维度的系统性检验,并借助SHA-256哈希实现审计结果的精确溯源。该工作为低资源语言与高资源语言间的翻译质量对比提供了平衡采样的基准,助力多语言问答系统性能的可靠评测与迭代优化,对推动生成式翻译模型的透明化、可复现性评估具有重要方法论意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务