遇见数据集

XhotpotQA-GLM52-Judge-V2

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

XHotpotQA GLM-5.2 Translation Judge — V2 是一个用于评估跨语言翻译质量的数据集,属于 XHotpotQA V2 RC1 版本的审计快照。该数据集使用 GLM-5.2 模型作为裁判,对原始英文段落、问题和短答案翻译成 23 种目标语言(包括阿拉伯语、孟加拉语、德语、希腊语、西班牙语、波斯语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、俄语、瑞典语、斯瓦希里语、泰语、土耳其语、乌尔都语、越南语、中文)的候选翻译进行 0-100 分评分。数据集包含 2,760 个有效样本,涵盖段落(1,840 条)、问题(460 条)和答案(460 条)三种单元,所有样本均成功评分。另外排除了 240 个因部分答案运行格式错误导致的无效行。公开字段包括 judge_record_id、dataset_version、instance_id、target_language、unit、paragraph_id、score、score_origin、judge_explanation、source_text_sha256、candidate_text_sha256、requested_judge_model(glm-5.2)、resolved_judge_revision(null)、judge_prompt_version、judge_prompt_sha256、run_group 等。评分加权平均值为 94.677,段落和问题分布集中,答案分布有较宽的下尾。该数据集可用于翻译质量评估、多语言多跳问答系统的审计与比较,尤其适合作为 LLM-as-a-judge 范式的基准。注意:V1 和 V2 的审计样本未配对,且该数据集仅代表审计快照,而非完整的人类质量标签。

XHotpotQA GLM-5.2 Translation Judge — V2 is a dataset for evaluating cross-lingual translation quality, belonging to the audit snapshot of the XHotpotQA V2 RC1 version. This dataset uses the GLM-5.2 model as a judge to score candidate translations of original English paragraphs, questions, and short answers into 23 target languages (including Arabic, Bengali, German, Greek, Spanish, Persian, French, Hindi, Indonesian, Italian, Japanese, Korean, Dutch, Polish, Portuguese, Russian, Swedish, Swahili, Thai, Turkish, Urdu, Vietnamese, and Chinese) on a scale of 0-100. The dataset contains 2,760 valid samples covering three types of units: paragraphs (1,840), questions (460), and answers (460), all of which were successfully scored. Additionally, 240 invalid rows due to format errors in some answer runs were excluded. Public fields include judge_record_id, dataset_version, instance_id, target_language, unit, paragraph_id, score, score_origin, judge_explanation, source_text_sha256, candidate_text_sha256, requested_judge_model (glm-5.2), resolved_judge_revision (null), judge_prompt_version, judge_prompt_sha256, run_group, etc. The weighted average score is 94.677, with concentrated distributions for paragraphs and questions, while answers have a wider lower tail. This dataset can be used for translation quality assessment, audit and comparison of multilingual multi-hop question-answering systems, and especially as a benchmark for the LLM-as-a-judge paradigm. Note: The audit samples of V1 and V2 are not paired, and this dataset only represents an audit snapshot, not complete human quality labels.

创建时间:
2026-08-22
原始信息汇总

XHotpotQA GLM-5.2 Translation Judge — V2 数据集概述

基本信息

  • 数据集名称: XHotpotQA GLM-5.2 Translation Judge — V2
  • 许可证: CC BY-SA 4.0
  • 任务类型: 文本分类(LLM-as-a-Judge 翻译质量评估)
  • 目标语言: 23种(包括阿拉伯语、孟加拉语、德语、希腊语、西班牙语、波斯语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、俄语、瑞典语、斯瓦希里语、泰语、土耳其语、乌尔都语、越南语、中文)
  • 数据规模: 2,760行(1K-10K范围)
  • 配置名称: xhotpotqa_glm52_judge_v2
  • 数据划分: 仅 audit 拆分(数据文件为 data/audit-*.parquet

核心内容

该数据集提供 XHotpotQA V2 RC1 翻译质量的最终审计快照。每个审计单元(段落、问题、短答案)均由 LLM 裁判(请求的模型为 glm-5.2)在 0-100 量表上对英文源文本与其翻译进行比较评分。

关键统计

  • 审计单元总数: 2,760
  • 排除的畸形行数: 240(部分答案不完整)
  • 加权平均分: 94.677
  • 评分覆盖: 100%成功

采样设计

  • 每语言段落80条、问题20条、答案20条,合计每语言120条
  • 采样种子: 20260810
  • 训练集衍生单元: 1,883
  • 验证集衍生单元: 877

评分结果

单元 数量 平均分 中位数 标准差
段落 1,840 94.468 96 7.53
问题 460 96.009 98 8.12
答案 460 94.183 100 19.46
加权总体 2,760 94.677

语言差异关注点

  • 希腊语段落在混合文字干扰、未翻译片段或含义反转方面得分较低
  • 泰语答案受拉丁字母专名保留和裁判对音译期望的影响较大
  • 中文答案在实体或标题渲染方面存在扣分现象

数据结构

核心字段

  • judge_record_id: 版本与单元身份的确定性哈希
  • instance_id, source_id, source_split: 稳定源定位信息
  • target_language, unit, paragraph_id: 审计身份与分层
  • score, score_origin: 整数评分与解析器来源
  • judge_explanation: 可见的解释文本
  • source_text_sha256, candidate_text_sha256: 文本精确验证哈希
  • requested_judge_model: glm-5.2
  • judge_prompt_version, judge_prompt_sha256: 评分契约

评分来源

  • 显式 SCORE: 行: 2,756行
  • 推理回退(最后整数): 4行

模型与配置

  • 温度: 0.0
  • 最大输出令牌: 4,000
  • 并发工作线程: 1
  • 提供方解析的裁判模型版本未记录

质量注意事项

  • 评分来自单一未校准的 LLM 裁判,而非双语人工标注
  • V1 和 V2 审计样本几乎完全不成对(重叠极少),不可视为配对比较
  • 高位数与显著的下尾失败并存
  • 审计覆盖均衡样本,非全部22,836条 RC1 行

数据获取

python from datasets import load_dataset

audit = load_dataset( "Iman998/XhotpotQA-GLM52-Judge-V2", "xhotpotqa_glm52_judge_v2", split="audit", revision="0f9cd568fabd7f7ad3b3d9a72e31ae8aeb936840", )

通过 instance_idunitparagraph_id 与固定的 XHotpotQA V2 RC1 快照 关联,以验证 SHA-256 字段。

搜集汇总
数据集介绍
XhotpotQA-GLM52-Judge-V2 数据集图片
构建方式
XHotpotQA-GLM52-Judge-V2 数据集是针对跨语言多跳问答任务 V2 RC1 版本翻译质量的审计快照。其构建过程基于 23 种目标语言的均衡抽样,每种语言包含 80 个段落、20 个问题和 20 个答案,共计 2760 个审计单元。每个单元由 GLM-5.2 模型依据英文源文本对目标语言候选进行 0-100 分的评分,评分过程参考严格的双语翻译评估协议。数据构建流程严格剔除了 240 个因源路径错误导致的畸形部分答案行,并对所有参数、提示词版本及源-候选文本对的 SHA-256 哈希进行锁定,确保每个评分记录的完整可追溯性。
特点
该数据集的核心特征在于其专业化的审计设计与多重质量保障机制。每个审计记录包含详尽的元数据,如目标语言、单元类型、评分来源、提示词版本哈希及文本校验哈希,支持精确的复现与验证。评分结果呈现出清晰的分布特征:段落与问题评分均值分别达 94.468 与 96.009,答案评分虽中位数高达 100,但存在显著的长尾分布,尤其在泰语、希腊语等特定语言上评分差异明显。数据集不包含源文本或候选文本的原始内容,仅保留必要的标识与哈希,有效规避了版权与隐私风险,同时保证了数据审计的严谨性。
使用方法
使用该数据集时,可通过 HuggingFace datasets 库加载特定版本 'xhotpotqa_glm52_judge_v2' 的审计分割,并搭配固定的修订哈希 '0f9cd568fabd7f7ad3b3d9a72e31ae8aeb936840'。每一行记录可通过 instance_id、unit 与 paragraph_id 与 XHotpotQA-V2 的源数据快照进行关联,并通过 SHA-256 哈希精确验证文本对的一致性。该数据集适用于评估跨语言翻译质量、分析不同语言下的模型表现差异,并为多语言问答系统的改进提供细粒度反馈。但需注意,评分仅为单模型审判,非人类标注,且 V1 与 V2 样本相互独立,不可直接配对比较。
背景与挑战
背景概述
XHotpotQA-GLM52-Judge-V2数据集发布于2026年,由Iman998团队基于XHotpotQA跨语言多跳问答基准构建,旨在利用GLM-5.2大语言模型作为裁判,对V2候选集的翻译质量进行系统性审计。该数据集涵盖23种目标语言,包含2760个审计单元,涵盖段落、问题与短答案三类,采用0-100分制评估忠实度、术语准确性、流畅性及风格适配性,并附有完整的提示词契约与哈希校验以保障溯源。其核心研究问题在于探索LLM-as-a-judge范式在跨语言翻译评估中的可靠性与一致性,为多语言问答系统的质量保障提供可复现的审计框架,对低资源语言机器翻译评估研究具有推动意义。
当前挑战
数据集面临的首要挑战源于LLM裁判的固有局限:评分源自单一大模型且未经人工校准,裁判模型的确切版本与服务器修订未知,导致分数可能受语言特定实体转写偏好影响,高众数掩盖了下尾分布的翻译劣化。构建过程中遭遇的难点包括:240条因错误源单元路径产生的畸形部分答案记录被剔除,276次瞬时API失败需重试恢复,且答案单元存在179条英文源文本副本需辨析为合法专名或历史回退。此外,V1与V2审计样本近乎完全不配对,无法进行因果推断,无法断言模型改进带来的确定效应。
常用场景
经典使用场景
XHotpotQA-GLM52-Judge-V2数据集作为跨语言多跳问答翻译质量审计的基准资源,其核心应用场景在于对机器翻译输出进行细粒度的质量评估。该数据集覆盖23种目标语言,包含段落、问题与简短答案三类单元的0-100分制评分,并附有法官模型的可解释性说明。研究者和工程师可借此开展大规模翻译质量评测,尤其在多语言、多跳问答这一复杂语境下,验证机器翻译系统在语义保真度、术语准确性、流畅性及风格一致性等多维度上的表现。其设计精良的评分规则与硬性错误下限机制,为跨语言自然语言处理研究提供了可靠的量化分析工具。
解决学术问题
该数据集系统性地回应了跨语言多跳问答中机器翻译质量评估缺乏标准化基准的学术难题。传统评测多依赖人工或单语指标,难以捕捉翻译中的语义扭曲、关键信息丢失及低资源语言的独特挑战。此数据集通过引入LLM-as-a-Judge范式,以GLM-5.2为裁判模型,结合严格的审计流程,提供了高置信度的质量标签。它解决了翻译质量评估中主观性过强、可复现性不足的问题,为比较不同翻译模型、优化提示词策略及探索跨语言知识迁移提供了实证基础,推动了多语言自然语言处理评测方法论的发展。
衍生相关工作
此数据集的发布衍生了一系列相关研究工作,集中在利用LLM进行翻译质量评估的方法论深化与跨语言问答系统的增强。一方面,研究者基于其审计框架探索更鲁棒的裁判模型校准技术,例如参考自由评估、不同法官模型的输出对齐,以及针对低资源语言的评估偏误修正。另一方面,该数据集促进了对多跳推理中跨语言信息一致性的研究,衍生出对翻译答案尾部分布、实体转写规范及文化适应性表达的专题分析。其V1与V2版本的对比研究,也为探究模型迭代对翻译质量的影响提供了非配对但可参照的实证窗口。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务