遇见数据集

quadmix-core-22tasks

收藏
Hugging Face2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

该数据集包含两个用于QuaDMix代理模型管道的验证集:OpenHermes-10k和CORE-22tasks,旨在为数据混合策略的快速评估提供质量信号。OpenHermes-10k验证集专注于评估通用指令跟随能力,其数据来源于OpenHermes-2.5-1M数据集,包含了10,000个经过采样的助手回复文本,所有非填充令牌均参与损失计算。CORE-22tasks验证集与DCLM CORE基准测试对齐,旨在评估模型在多样化任务上的能力分布,覆盖21个任务,涵盖世界知识、语言理解、常识推理、符号问题解决和阅读理解五大类别,采用“仅续写”损失策略以最大化信号纯度。数据规模方面,CORE-22tasks包含46,926个文档,每个任务最多采样5,000个文档。两个数据集均使用GPT-NeoX-20B分词器处理,并以PyTorch .pt文件格式提供,包含令牌ID、损失掩码、任务标签和元数据,适用于优化语言模型训练的数据混合策略。

This dataset includes two validation sets for the QuaDMix agent model pipeline: OpenHermes-10k and CORE-22tasks, designed to provide quality signals for rapid evaluation of data mixing strategies. The OpenHermes-10k validation set focuses on assessing general instruction-following capabilities, with data sourced from the OpenHermes-2.5-1M dataset, containing 10,000 sampled assistant response texts, where all non-padding tokens are included in loss calculation. The CORE-22tasks validation set aligns with the DCLM CORE benchmark, aimed at evaluating the models ability distribution across diverse tasks, covering 21 tasks across five categories: world knowledge, language understanding, commonsense reasoning, symbolic problem-solving, and reading comprehension. It employs a continuation-only loss strategy to maximize signal purity. In terms of data scale, CORE-22tasks comprises 46,926 documents, with up to 5,000 documents sampled per task. Both datasets are processed using the GPT-NeoX-20B tokenizer and provided in PyTorch .pt file format, including token IDs, loss masks, task labels, and metadata, suitable for optimizing data mixing strategies in language model training.

创建时间:
2026-06-09
原始信息汇总

QuaDMix 验证集概况

该数据集包含 QuaDMix 代理模型流程中使用的两套验证集,用于评估数据混合策略的质量。

验证集构成

数据集提供两套验证集:

1. OpenHermes-10k

  • 用途:衡量通用指令遵循质量
  • 来源:从 OpenHermes-2.5-1M 数据集中采样 10,000 条助手回复
  • 分词器:GPT-NeoX-20B(词表大小 50,432)
  • 损失策略:所有非填充标记均参与损失计算 (assistant_only_all_tokens)
  • 配置:10,000 个文档 × 2048 个标记
  • HuggingFace 地址:https://huggingface.co/datasets/liujin99/quadmix-openhermes-10k

2. CORE-22tasks(推荐)

  • 用途:衡量基准对齐能力
  • 来源:DCLM CORE 基准测试中的 21 个去重任务
  • 损失策略:仅连续标记(continuation tokens)参与损失计算
  • 文档数量:46,926 个文档(每类任务最多取 5,000 个文档)
  • 连续标记总数:约 318,000 个
  • HuggingFace 地址:https://huggingface.co/datasets/liujin99/quadmix-core-22tasks

任务覆盖范围

CORE-22tasks 涵盖 5 大类别共 21 个任务:

类别 任务
世界知识 Jeopardy、ARC Easy、ARC Challenge、BigBench QA Wikidata
语言理解 HellaSwag、LAMBADA、Winograd、Winogrande、BigBench Language ID
常识推理 COPA、CommonsenseQA、PIQA、OpenBookQA
符号问题求解 BigBench Dyck、Operators、CS Algorithms、Repeat Copy Logic、AGI Eval LSAT-AR
阅读理解 SQuAD、CoQA、BoolQ

文件格式

验证集以 PyTorch .pt 文件格式保存,包含以下字段:

  • token_idstorch.LongTensor,形状 [num_docs, block_size],用 pad_token_id (0) 填充
  • loss_masktorch.BoolTensor,形状 [num_docs, block_size]True 表示参与损失计算
  • task_labelslist[str],每个文档的任务标签(仅 CORE-22tasks)
  • metadatadict,包含来源信息、分词器、策略说明

损失计算方式

验证损失计算方式为:

val_loss = mean over docs of (sum(loss * mask) / count(mask))

其中 mask 向左偏移 1 个位置以对齐下一个标记预测目标。

技术细节

  • 分词器:两套验证集均使用 GPT-NeoX-20B 分词器(词表大小 50,432)
  • 块大小:默认 2048 个标记,超过则截断,不足则用 pad_token_id (0) 填充
  • 去重:CORE-22tasks 中排除 hellaswag_zeroshothellaswag 重复项

使用方式

bash

使用 OpenHermes-10k

python scripts/run_essential_web_v1.py --quick --val-set=openhermes

使用 CORE-22tasks

python scripts/run_essential_web_v1.py --quick --val-set=core

搜集汇总
数据集介绍
quadmix-core-22tasks 数据集图片
构建方式
该数据集专为QuaDMix代理模型管道设计,旨在通过衡量不同数据混合策略下小型代理模型的困惑度来评估其质量。其构建基于DCLM CORE基准测试中的22项任务,涵盖世界知识、语言理解、常识推理、符号问题解决与阅读理解五大类别。针对每项任务,根据类型提取(上下文,延续)对:多项选择任务以查询加分隔符为上下文、正确答案为延续;语言建模任务以文本加分隔符为上下文、延续为补全;模式任务则以正确选项加分隔符为上下文。所有任务均从原始数据中采样,上限为每项任务5000个文档,数据贫乏任务则取全部可用数据,不做上采样以避免信息冗余。随后,这些样本经GPT-NeoX-20B分词器处理为固定长度2048的序列,并生成仅标记延续词元的损失掩码,最终保存为PyTorch .pt格式文件。
使用方法
使用该数据集需运行QuaDMix代理模型评估脚本,并通过命令行参数指定验证集:执行`python scripts/run_essential_web_v1.py --quick --val-set=core`即可自动从HuggingFace下载`liujin99/quadmix-core-22tasks`数据。脚本会加载`.pt`文件,采用1位置偏移的损失计算方式:输入为`token_ids[:-1]`,目标为`token_ids[1:]`,掩码为`loss_mask[1:]`,计算逐词元的交叉熵损失后,按文档求掩码均值,最终取全局平均作为验证损失。数据集还支持任务级分析,通过`task_labels`字段分组计算各任务损失,以评估不同混合策略对具体能力的影响。如需本地重生成,可使用`prepare_core_val_set.py`脚本自定义参数,如任务采样上限和块大小。
背景与挑战
背景概述
QuaDMix-CORE-22tasks数据集由Liu等人于2025年提出,旨在提升语言模型在多样化能力基准上的表现。该数据集基于DCLM基准测试,涵盖世界知识、语言理解、常识推理、符号问题求解和阅读理解五大类共21项任务,通过抽取任务的上下文与正确延续对,构建了具有高度信号纯度的验证集。其核心创新在于采用仅对延续部分计算损失(continuation-only loss)的策略,有效避免了上下文噪声对数据混合评估的干扰。与通用指令遵循验证集OpenHermes-10k相比,CORE-22tasks在评估面向特定能力的数据混合策略时展现出更强的区分度和下游任务迁移效果,为数据混合优化领域提供了重要的评估工具。
当前挑战
该数据集面临的核心挑战在于如何精确评估数据混合策略对特定能力的影响。基准测试文本中上下文部分占比高达94.8%,若采用全序列损失,上下文噪声会淹没延续部分仅有的5.2%信号,导致验证集无法有效区分不同数据混合的质量差异。为此,数据集采用了延续仅损失策略来剔除噪声,但这也大幅减少了有效信号词元数量至约31.8万,可能削弱统计效力。因此,构建过程中通过将每个任务的采样上限提高至5000篇文档(共46,926篇),以充足样本量补偿信号词元的稀疏性,同时避免对数据稀疏任务进行上采样以维持信息多样性,最终实现了在信号纯度与统计可靠性之间的平衡。
常用场景
经典使用场景
在语言模型的数据混合优化研究中,quadmix-core-22tasks验证集扮演着关键角色。它专为评估代理模型在不同数据采样策略下的学习效果而设计,通过与DCLM CORE基准对齐的21个任务,覆盖世界知识、语言理解、常识推理、符号问题求解和阅读理解五大认知维度。研究人员利用该验证集的续接-only损失机制,精准度量数据分布与目标能力的匹配程度,从而快速筛选出最优的数据混合方案。其中,每项任务提取正确的续接文本作为信号,并采用上限5000文档的均衡采样策略,确保统计效力与评估效率的平衡。这使得quadmix-core-22tasks成为能力导向型数据混合优化的首选验证工具。
解决学术问题
该数据集解决了语言模型预训练数据混合研究中一个关键难题:如何在小规模代理模型上有效评估不同数据采样策略对特定能力的影响。此前,直接使用基准任务评估1M参数的代理模型并不现实,而全序列损失又会因上下文占主导而淹没续接信号。quadmix-core-22tasks通过续接-only损失设计,将信号纯度提升至100%,消除了上下文噪声的干扰。同时,大文档数量补偿了每文档信号稀疏的不足,使统计效力足以分辨不同数据混合间的微小差异。这一创新为数据混合优化领域提供了可靠的评估信号,推动了从经验性调优向可量化、可复现的分布匹配方法的转变。
实际应用
在实际应用中,quadmix-core-22tasks验证集主要用于指导大规模语言模型预训练数据配比的优化。研究者将其嵌入QuaDMix代理模型流程,通过快速训练小模型并计算验证困惑度,评估候选数据混合的质量。该验证集特别适合需要针对性提升模型特定能力(如常识推理或阅读理解)的场景,例如教育AI系统的知识整合、对话助手的逻辑严谨性增强,或是科研文献分析工具的世界知识覆盖。其基准对齐特性确保优化方向与下游任务表现一致,已成功应用于多任务数据混合策略的自动化搜索,显著降低了人力调参成本。
数据集最近研究
最新研究方向
在数据配比优化领域,quadmix-core-22tasks数据集的研究前沿聚焦于通过代理模型进行高效数据混合质量评估。其核心创新在于采用续接式损失掩码策略,仅对答案令牌计算损失,解决了传统全序列损失中上下文噪声淹没信号的问题。该数据集涵盖21项DCLM基准任务,横跨世界知识、语言理解、常识推理等五大能力维度,为数据配比研究提供了更精准的能力对齐信号。相关研究证实,基于基准对齐的验证集(如QuaDMix-BMK变体)在多项下游任务上显著优于通用指令遵循验证集,揭示了数据混合策略与特定能力培养之间的深刻关联,推动了从通用数据配比向能力定向混合的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务