XhotpotQA-GLM52-Judge-V2
收藏资源简介:
XHotpotQA GLM-5.2 Translation Judge — V2 是一个用于评估跨语言翻译质量的数据集,属于 XHotpotQA V2 RC1 版本的审计快照。该数据集使用 GLM-5.2 模型作为裁判,对原始英文段落、问题和短答案翻译成 23 种目标语言(包括阿拉伯语、孟加拉语、德语、希腊语、西班牙语、波斯语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、俄语、瑞典语、斯瓦希里语、泰语、土耳其语、乌尔都语、越南语、中文)的候选翻译进行 0-100 分评分。数据集包含 2,760 个有效样本,涵盖段落(1,840 条)、问题(460 条)和答案(460 条)三种单元,所有样本均成功评分。另外排除了 240 个因部分答案运行格式错误导致的无效行。公开字段包括 judge_record_id、dataset_version、instance_id、target_language、unit、paragraph_id、score、score_origin、judge_explanation、source_text_sha256、candidate_text_sha256、requested_judge_model(glm-5.2)、resolved_judge_revision(null)、judge_prompt_version、judge_prompt_sha256、run_group 等。评分加权平均值为 94.677,段落和问题分布集中,答案分布有较宽的下尾。该数据集可用于翻译质量评估、多语言多跳问答系统的审计与比较,尤其适合作为 LLM-as-a-judge 范式的基准。注意:V1 和 V2 的审计样本未配对,且该数据集仅代表审计快照,而非完整的人类质量标签。
XHotpotQA GLM-5.2 Translation Judge — V2 is a dataset for evaluating cross-lingual translation quality, belonging to the audit snapshot of the XHotpotQA V2 RC1 version. This dataset uses the GLM-5.2 model as a judge to score candidate translations of original English paragraphs, questions, and short answers into 23 target languages (including Arabic, Bengali, German, Greek, Spanish, Persian, French, Hindi, Indonesian, Italian, Japanese, Korean, Dutch, Polish, Portuguese, Russian, Swedish, Swahili, Thai, Turkish, Urdu, Vietnamese, and Chinese) on a scale of 0-100. The dataset contains 2,760 valid samples covering three types of units: paragraphs (1,840), questions (460), and answers (460), all of which were successfully scored. Additionally, 240 invalid rows due to format errors in some answer runs were excluded. Public fields include judge_record_id, dataset_version, instance_id, target_language, unit, paragraph_id, score, score_origin, judge_explanation, source_text_sha256, candidate_text_sha256, requested_judge_model (glm-5.2), resolved_judge_revision (null), judge_prompt_version, judge_prompt_sha256, run_group, etc. The weighted average score is 94.677, with concentrated distributions for paragraphs and questions, while answers have a wider lower tail. This dataset can be used for translation quality assessment, audit and comparison of multilingual multi-hop question-answering systems, and especially as a benchmark for the LLM-as-a-judge paradigm. Note: The audit samples of V1 and V2 are not paired, and this dataset only represents an audit snapshot, not complete human quality labels.
XHotpotQA GLM-5.2 Translation Judge — V2 数据集概述
基本信息
- 数据集名称: XHotpotQA GLM-5.2 Translation Judge — V2
- 许可证: CC BY-SA 4.0
- 任务类型: 文本分类(LLM-as-a-Judge 翻译质量评估)
- 目标语言: 23种(包括阿拉伯语、孟加拉语、德语、希腊语、西班牙语、波斯语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、俄语、瑞典语、斯瓦希里语、泰语、土耳其语、乌尔都语、越南语、中文)
- 数据规模: 2,760行(1K-10K范围)
- 配置名称:
xhotpotqa_glm52_judge_v2 - 数据划分: 仅
audit拆分(数据文件为data/audit-*.parquet)
核心内容
该数据集提供 XHotpotQA V2 RC1 翻译质量的最终审计快照。每个审计单元(段落、问题、短答案)均由 LLM 裁判(请求的模型为 glm-5.2)在 0-100 量表上对英文源文本与其翻译进行比较评分。
关键统计
- 审计单元总数: 2,760
- 排除的畸形行数: 240(部分答案不完整)
- 加权平均分: 94.677
- 评分覆盖: 100%成功
采样设计
- 每语言段落80条、问题20条、答案20条,合计每语言120条
- 采样种子:
20260810 - 训练集衍生单元: 1,883
- 验证集衍生单元: 877
评分结果
| 单元 | 数量 | 平均分 | 中位数 | 标准差 |
|---|---|---|---|---|
| 段落 | 1,840 | 94.468 | 96 | 7.53 |
| 问题 | 460 | 96.009 | 98 | 8.12 |
| 答案 | 460 | 94.183 | 100 | 19.46 |
| 加权总体 | 2,760 | 94.677 | — | — |
语言差异关注点
- 希腊语段落在混合文字干扰、未翻译片段或含义反转方面得分较低
- 泰语答案受拉丁字母专名保留和裁判对音译期望的影响较大
- 中文答案在实体或标题渲染方面存在扣分现象
数据结构
核心字段
judge_record_id: 版本与单元身份的确定性哈希instance_id,source_id,source_split: 稳定源定位信息target_language,unit,paragraph_id: 审计身份与分层score,score_origin: 整数评分与解析器来源judge_explanation: 可见的解释文本source_text_sha256,candidate_text_sha256: 文本精确验证哈希requested_judge_model:glm-5.2judge_prompt_version,judge_prompt_sha256: 评分契约
评分来源
- 显式
SCORE:行: 2,756行 - 推理回退(最后整数): 4行
模型与配置
- 温度: 0.0
- 最大输出令牌: 4,000
- 并发工作线程: 1
- 提供方解析的裁判模型版本未记录
质量注意事项
- 评分来自单一未校准的 LLM 裁判,而非双语人工标注
- V1 和 V2 审计样本几乎完全不成对(重叠极少),不可视为配对比较
- 高位数与显著的下尾失败并存
- 审计覆盖均衡样本,非全部22,836条 RC1 行
数据获取
python from datasets import load_dataset
audit = load_dataset( "Iman998/XhotpotQA-GLM52-Judge-V2", "xhotpotqa_glm52_judge_v2", split="audit", revision="0f9cd568fabd7f7ad3b3d9a72e31ae8aeb936840", )
通过 instance_id、unit 和 paragraph_id 与固定的 XHotpotQA V2 RC1 快照 关联,以验证 SHA-256 字段。





