quadmix-core-22tasks
收藏资源简介:
该数据集包含两个用于QuaDMix代理模型管道的验证集:OpenHermes-10k和CORE-22tasks,旨在为数据混合策略的快速评估提供质量信号。OpenHermes-10k验证集专注于评估通用指令跟随能力,其数据来源于OpenHermes-2.5-1M数据集,包含了10,000个经过采样的助手回复文本,所有非填充令牌均参与损失计算。CORE-22tasks验证集与DCLM CORE基准测试对齐,旨在评估模型在多样化任务上的能力分布,覆盖21个任务,涵盖世界知识、语言理解、常识推理、符号问题解决和阅读理解五大类别,采用“仅续写”损失策略以最大化信号纯度。数据规模方面,CORE-22tasks包含46,926个文档,每个任务最多采样5,000个文档。两个数据集均使用GPT-NeoX-20B分词器处理,并以PyTorch .pt文件格式提供,包含令牌ID、损失掩码、任务标签和元数据,适用于优化语言模型训练的数据混合策略。
This dataset includes two validation sets for the QuaDMix agent model pipeline: OpenHermes-10k and CORE-22tasks, designed to provide quality signals for rapid evaluation of data mixing strategies. The OpenHermes-10k validation set focuses on assessing general instruction-following capabilities, with data sourced from the OpenHermes-2.5-1M dataset, containing 10,000 sampled assistant response texts, where all non-padding tokens are included in loss calculation. The CORE-22tasks validation set aligns with the DCLM CORE benchmark, aimed at evaluating the models ability distribution across diverse tasks, covering 21 tasks across five categories: world knowledge, language understanding, commonsense reasoning, symbolic problem-solving, and reading comprehension. It employs a continuation-only loss strategy to maximize signal purity. In terms of data scale, CORE-22tasks comprises 46,926 documents, with up to 5,000 documents sampled per task. Both datasets are processed using the GPT-NeoX-20B tokenizer and provided in PyTorch .pt file format, including token IDs, loss masks, task labels, and metadata, suitable for optimizing data mixing strategies in language model training.
QuaDMix 验证集概况
该数据集包含 QuaDMix 代理模型流程中使用的两套验证集,用于评估数据混合策略的质量。
验证集构成
数据集提供两套验证集:
1. OpenHermes-10k
- 用途:衡量通用指令遵循质量
- 来源:从 OpenHermes-2.5-1M 数据集中采样 10,000 条助手回复
- 分词器:GPT-NeoX-20B(词表大小 50,432)
- 损失策略:所有非填充标记均参与损失计算 (
assistant_only_all_tokens) - 配置:10,000 个文档 × 2048 个标记
- HuggingFace 地址:https://huggingface.co/datasets/liujin99/quadmix-openhermes-10k
2. CORE-22tasks(推荐)
- 用途:衡量基准对齐能力
- 来源:DCLM CORE 基准测试中的 21 个去重任务
- 损失策略:仅连续标记(continuation tokens)参与损失计算
- 文档数量:46,926 个文档(每类任务最多取 5,000 个文档)
- 连续标记总数:约 318,000 个
- HuggingFace 地址:https://huggingface.co/datasets/liujin99/quadmix-core-22tasks
任务覆盖范围
CORE-22tasks 涵盖 5 大类别共 21 个任务:
| 类别 | 任务 |
|---|---|
| 世界知识 | Jeopardy、ARC Easy、ARC Challenge、BigBench QA Wikidata |
| 语言理解 | HellaSwag、LAMBADA、Winograd、Winogrande、BigBench Language ID |
| 常识推理 | COPA、CommonsenseQA、PIQA、OpenBookQA |
| 符号问题求解 | BigBench Dyck、Operators、CS Algorithms、Repeat Copy Logic、AGI Eval LSAT-AR |
| 阅读理解 | SQuAD、CoQA、BoolQ |
文件格式
验证集以 PyTorch .pt 文件格式保存,包含以下字段:
token_ids:torch.LongTensor,形状[num_docs, block_size],用pad_token_id (0)填充loss_mask:torch.BoolTensor,形状[num_docs, block_size],True表示参与损失计算task_labels:list[str],每个文档的任务标签(仅 CORE-22tasks)metadata:dict,包含来源信息、分词器、策略说明
损失计算方式
验证损失计算方式为:
val_loss = mean over docs of (sum(loss * mask) / count(mask))
其中 mask 向左偏移 1 个位置以对齐下一个标记预测目标。
技术细节
- 分词器:两套验证集均使用 GPT-NeoX-20B 分词器(词表大小 50,432)
- 块大小:默认 2048 个标记,超过则截断,不足则用
pad_token_id (0)填充 - 去重:CORE-22tasks 中排除
hellaswag_zeroshot和hellaswag重复项
使用方式
bash
使用 OpenHermes-10k
python scripts/run_essential_web_v1.py --quick --val-set=openhermes
使用 CORE-22tasks
python scripts/run_essential_web_v1.py --quick --val-set=core




