遇见数据集

Entropy-Valley-Datasets

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

Entropy-Valley数据集是为支持掩码扩散机器翻译中的无训练目标长度选择方法(Entropy-Valley,EV)而构建的。该数据集包含LoRA-SFT训练数据、WMT22评估集以及用于诊断性分析的挑战子集,旨在评估EV在固定尺寸画布上选择最优目标长度(通过预测熵最小化)的性能。数据集包括两个主要翻译方向配置:中文-英文(enzh)和英文-德文(ende),以及五个挑战子集(覆盖度、数字、命名实体、日期、枚举、生育率不匹配)。所有数据以JSONL格式存储,每行一个JSON对象。训练/验证数据源自WMT19语料,经过长度过滤(英文5-200词,中文2-600字符,德文5-200词)并随机排序后,前200,000条作为训练集,后2,000条作为验证集。测试集使用官方WMT22新闻翻译测试集(每方向2,037条)。挑战子集从WMT22中-英测试集中提取,每个类别最多200条,并包含原始索引以追溯来源。该数据集仅用于机器翻译研究,遵循WMT研究条款。

The Entropy-Valley dataset is constructed to support the training-free target length selection method (Entropy-Valley, EV) for masked diffusion machine translation. It contains LoRA-SFT training data, the WMT22 evaluation set, and challenge subsets for diagnostic analysis, aiming to evaluate EVs performance in selecting the optimal target length (via prediction entropy minimization) on a fixed-size canvas. The dataset includes two main translation direction configurations: Chinese-English (enzh) and English-German (ende), along with five challenge subsets (coverage, digits, named entities, dates, enumeration, fertility mismatch). All data is stored in JSONL format, with one JSON object per line. The training/validation data originates from the WMT19 corpus, filtered by length (English: 5-200 words, Chinese: 2-600 characters, German: 5-200 words) and randomly shuffled, with the first 200,000 entries as the training set and the next 2,000 as the validation set. The test set uses the official WMT22 news translation test set (2,037 entries per direction). The challenge subsets are extracted from the WMT22 Chinese-English test set, with up to 200 entries per category and original indices for traceability. This dataset is intended solely for machine translation research, adhering to WMT research terms.

创建时间:
2026-08-21
原始信息汇总

Entropy-Valley Datasets 数据集概述

数据集简介

Entropy-Valley Datasets 是论文《Length-Adaptive Decoding for Masked Diffusion Machine Translation》(EMNLP 2026)中提出的 Entropy-Valley (EV) 方法所使用的数据集合。EV 是一种针对掩码扩散机器翻译的无训练目标长度选择器,通过单次全掩码前向传播探测 5 个候选画布长度,选择平均预测熵最低者。该数据集包含 LoRA-SFT 训练数据、WMT22 评估集及诊断性挑战子集。

数据配置与规模

配置名 划分 行数 字段 用途
enzh train 200,000 en, zh En↔Zh 双向的 LoRA-SFT 数据
enzh validation 2,000 en, zh 保留开发集(不用于调优 EV)
enzh test 2,037 en, zh WMT22 新闻测试集(主结果表)
ende train 200,000 en, de En→De 的 LoRA-SFT 数据
ende validation 2,000 en, de 保留开发集
ende test 2,037 en, de WMT22 新闻测试集(En→De)
challenge_coverage_zh test 400 en, zh, challenge_categories, idx 揭示顺序诊断的并集子集
challenge_numbers test 200 en, zh, challenge_category, idx 含数字序列的句子
challenge_named_entities test 200 en, zh, challenge_category, idx 大写多词跨度
challenge_dates test 63 en, zh, challenge_category, idx 年/月/星期词元
challenge_enumeration test 131 en, zh, challenge_category, idx 逗号分隔的 ≥3 项列表
challenge_fertility_mismatch test 14 en, zh, challenge_category, idx 源-目标长度比离群值

所有文件均为 JSONL 格式,每行一个 JSON 对象,无嵌套结构。

数据构建方法

训练集与开发集

  • En↔Zh:基于 HuggingFace wmt19 语料中 zh-en 训练集,过滤条件为英文空格分词长度 5-200、中文字符数 2-600。
  • En→De:基于 wmt19 语料中 de-en 训练集(seed=42 洗牌),过滤条件为英文和德文分词长度均为 5-200。
  • 过滤后使用 random.seed(42) 确定性洗牌,前 200,000 条为训练集,随后 2,000 条为开发集。
  • 仅应用单侧长度过滤,无语言 ID 分类器,无源-目标长度比过滤。
  • 开发集不用于设置 EV 的比率网格或解码超参数。

测试集

  • 官方 WMT22 新闻翻译测试集,每个方向 2,037 条。
  • En↔Zh 来自 WMT22 新闻系统仓库,En→De 通过 sacreBLEU 获取。
  • Zh→En 复用 enzh 文件,交换源/目标角色,无独立 zhen 配置。

挑战子集

  • wmt22_enzh_test.jsonl 派生,每类别最多 200 条,子集之间不互斥。
  • challenge_coverage_zh 是 400 句并集,用于揭示顺序诊断。
  • idx 字段指向 WMT22 测试集的原始行索引,可追溯每条挑战样例来源。

使用方式

python from datasets import load_dataset

enzh = load_dataset("YanZhanPKU/Entropy-Valley-Datasets", "enzh") nums = load_dataset("YanZhanPKU/Entropy-Valley-Datasets", "challenge_numbers", split="test")

也可通过 huggingface-cli download 下载原始 JSONL 文件树,运行完整代码流程。

许可与来源

  • 数据为 WMT19 训练语料和 WMT22 新闻测试集的派生子集,以 JSONL 格式重新分发,非全新语料,未完整镜像原始 WMT 分布。
  • 使用受原始 WMT 条款约束,允许用于机器翻译研究。
  • 引用论文为论文及 WMT19/WMT22 共享任务成果。
搜集汇总
数据集介绍
Entropy-Valley-Datasets 数据集图片
构建方式
Entropy-Valley数据集的构建基于公开的WMT19训练语料与WMT22新闻测试集,通过精心设计的过滤与采样协议生成。训练与验证分割源自wmt19的zh-en和de-en语料,依据长度阈值(英文词数5至200,中文字符2至600,德文词数5至200)进行筛选,并在随机种子42下确定性混洗,依次抽取二十万条训练样本与两千条验证样本。测试集则直接整合WMT22官方新闻测试语料,每方向含2037条平行句对。此外,从WMT22英中测试集中衍生出六类挑战性子集,涵盖数字、命名实体、日期、枚举及生育率失配等特定语言现象,每类最多收集200条,以JSONL格式存储,并保留源行索引以便追溯。
特点
该数据集的核心特点在于其高针对性与诊断性,专为掩码扩散机器翻译中的目标长度选择难题而设计。它不仅提供了标准平行语料以支持LoRA微调,还创新性地引入了挑战性子集,用于精准评估模型在特定语言现象下的长度预测能力。所有数据均以简洁的JSONL格式组织,字段清晰,且完全可复现于公开的WMT资源,无人工标注,确保了研究的公正性与可验证性。此外,数据集覆盖多种语言对及测试场景,助力深入剖析解码策略的鲁棒性。
使用方法
使用者可直接通过HuggingFace datasets库加载各配置项,如'enzh'、'ende'及各类挑战子集,快速获取训练、验证与测试数据。同时,数据集JSONL的文件结构便于本地化操作,可通过huggingface-cli一键下载,无缝对接关联的代码仓库,一键运行完整的训练评估流程。挑战子集中的样例携带类别标签与原始索引,便于结合具体任务进行细粒度分析,为长度自适应解码的深入研究提供便捷工具。
背景与挑战
背景概述
Entropy-Valley Datasets由北京大学Zhan Yan等研究者于2026年发布,服务于其提出的Entropy-Valley(EV)方法,该方法为掩码扩散机器翻译设计了一种免训练的目标长度选择器。该数据集基于WMT19和WMT22公开语料构建,包含英中、英德方向的训练、验证与测试子集,并衍生出针对数字、命名实体、日期等挑战性语言现象的专项测试集。其核心研究问题在于解决掩码扩散模型在去噪前需预先确定目标长度、而传统启发式规则难以适应不同语言对和句子复杂度的困境。该数据集为可复现的EV评估提供了标准化基准,对扩散语言模型的解码效率与译文质量研究具有重要推动作用。
当前挑战
掩码扩散翻译模型需在去噪前固定目标长度,而源句与目标句长度比例波动剧烈,单一长度或简单统计规则难以覆盖多样性,这构成了首要挑战。为应对该问题,EV通过候选长度熵比较进行选择,但数据集中挑战子集的构建亦面临难点,如从WMT22测试集中精准筛选出包含数字序列、命名实体、日期等句法敏感特征的样本,需保证类别代表性与非互斥性。此外,训练数据仅施加单侧长度过滤,未引入语言筛选或长度比约束,旨在保留自然分布,却也导致模型须在无显式监督下适应潜在的长度失配,增加了长度决策的鲁棒性要求。
常用场景
经典使用场景
Entropy-Valley数据集专为掩码扩散语言模型在机器翻译中的目标长度自适应选择而构建。其核心用途在于,通过提供源自WMT19和WMT22的平行语料,以及精心设计的挑战性子集,支持对扩散式翻译模型在解码前确定目标序列长度的关键环节进行训练与评估。研究人员可借此复现长度自适应解码方法,并系统性地考察模型在不同长度、不同特征句子(如数字、命名实体、日期等)下的翻译性能,从而在可控条件下深入探索扩散模型的条件生成机制。
解决学术问题
该数据集直击掩码扩散翻译模型的一个核心疑难:固定的画布尺寸要求预先设定目标长度,而长度选择的优劣直接决定了生成质量。在以往的研究中,长度预测常依赖额外的参数模型或启发式规则,缺乏通用且无需额外训练的解决方案。Entropy-Valley基于预测熵的零训练长度选择器,通过一次全掩码前向传播即可优选长度,有效解决了长度与内容不匹配、生成不充分或冗余等问题,为扩散式翻译模型提供了一种稳健、高效的长度决策范式,丰富了条件文本生成的理论与方法。
衍生相关工作
此数据集的发布催生了一系列后续探索。其核心思想——利用熵信号进行零训练长度决策——被借鉴到其他扩散生成任务,如文本摘要、对话响应生成及代码补全中的长度控制。围绕该数据集构建的挑战集评测框架,推动了针对数字、命名实体等细粒度翻译难点的诊断性研究,衍生出多篇关于掩码扩散模型可解释性及鲁棒性增强的工作。此外,基于其LoRA适配数据的训练流程,启发了参数高效微调与多语言能力迁移的相关研究,进一步丰富了文本扩散模型的实证基础与应用版图。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务