Harvard-DCML/tis-dolci-subset-datasets-Olmo-3-1025-7B
收藏官方服务:
资源简介:
该数据集包含来自多个源数据集(BBH、Codex、GSM8K、MMLU-Pro、TyDiQA)的采样子集,每个子集的大小为10000个训练样本。数据采用对话格式,包含消息内容和角色,并记录了源数据集和领域信息。采样方法包括多种策略,如基于梯度的数据选择(LESS-DG)、KNN密度估计(LESS-KNN-KDE)、均匀KNN(LESS-KNN-UNIFORM)、随机选择(LESS-RR)、不确定性采样(LESS-UOT)和随机子集(RDS-RR)。
This dataset contains sampled subsets from multiple source datasets (BBH, Codex, GSM8K, MMLU-Pro, TyDiQA), each with 10,000 training examples. The data is in a dialogue format, including message content and role, and records the source dataset and domain. The sampling methods include various strategies such as gradient-based data selection (LESS-DG), KNN density estimation (LESS-KNN-KDE), uniform KNN (LESS-KNN-UNIFORM), random selection (LESS-RR), uncertainty sampling (LESS-UOT), and random subset (RDS-RR).
提供机构:
Harvard-DCML搜集汇总
数据集介绍

构建方式
在大型语言模型的数据选择与课程学习研究中,该数据集通过多种采样策略从原始语料中提炼出高质量子集。其构建依托五个基准任务——BBH、Codex、GSM8K、MMLU-Pro和TyDiQA,各任务均包含四个采样变体:LESS-DG、LESS-KNN-KDE、LESS-KNN-Uniform、LESS-RR、LESS-UOT及RDS-RR。每个变体独立配置,选取10,000条训练样本,共计30个配置。样本以对话消息形式封装,保留源数据集与领域标签,便于溯源与评估。
使用方法
使用该数据集时,研究者可通过Hugging Face Datasets库加载指定配置,例如选择less_dg_bbh_10000或rds_rr_gsm8k_10000等,以获取对应的训练子集。加载后可直接访问id、messages、source_dataset及domain等字段,用于模型微调、数据选择算法比较或课程学习实验。各配置的train划分已预先定义,无需额外预处理,便于在统一框架下开展可复现的评估与对照研究。
背景与挑战
背景概述
大规模语言模型的数据选择策略对下游任务性能具有决定性影响,然而如何从海量语料中甄别高价值样本始终是数据工程领域的核心难题。tis-dolci-subset-datasets-Olmo-3-1025-7B数据集于2025年前后由Allen Institute for AI(AI2)的研究团队构建,作为OLMo-3系列模型数据 curation 流程的组成部分,旨在系统评估不同数据选择算法在多样化任务域中的效用。该数据集将BBH、Codex、GSM8K、MMLU-Pro与TyDiQA五大基准任务的数据分别经由LESS-DS、LESS-KNN(KDE与均匀两种变体)、LESS-RR、LESS-UOT及RDS-RR等策略筛选出1万条训练样本,覆盖逻辑推理、代码生成、数学解题、多学科知识问答与多语言阅读理解等能力维度,为数据选择方法的可复现比较提供了标准化实验平台,对推动数据-centric AI研究具有基础性意义。
当前挑战
该数据集所应对的领域问题在于:如何在缺乏目标任务标注信息的条件下,从大规模候选池中筛选出能够最大化特定下游任务微调效果的训练样本,这一直是数据选择研究的核心挑战。构建过程中面临多重困难:不同数据选择策略(如基于影响函数的LESS系列与基于分布匹配的RDS-RR)在实现细节上差异显著,确保各配置下样本选择过程的一致性与可复现性需要精心的工程控制;五大源数据集在格式、长度分布与领域特征上迥异,统一封装为messages格式时需兼顾原始语义完整性与结构规范性;此外,每配置固定1万条样本的规模设定虽保障了比较公平性,却也限制了在小样本场景下对算法细粒度差异的探测能力。
常用场景
经典使用场景
在大语言模型数据筛选与课程学习的研究中,该数据集构成了一个系统性的受控实验平台。其核心使用场景在于,研究者可借助Olmo-3-1025-7B模型对不同筛选策略下生成的多领域指令样本进行对比分析。数据集覆盖BBH、Codex、GSM8K、MMLU-Pro与TyDiQA五大任务域,每个配置包含一万条训练样本,并以less_dg、less_knn_kde、less_knn_uniform、less_rr、less_uot及rds_rr等策略区分数据选择方法。这一设计使研究者能够在统一框架下评估数据选择对模型训练动态的影响,为数据高效学习提供标准化基准。
解决学术问题
该数据集直面数据高效学习领域的核心难题,即如何在有限计算预算下从大规模语料中筛选出最具训练价值的样本。传统方法依赖随机采样或启发式规则,难以刻画样本对模型能力提升的差异化贡献。通过系统对比基于去重、KNN核密度估计、均匀采样、奖励重排及最优传输等多种策略所生成的数据子集,该数据集使研究者得以量化不同选择准则在推理、代码、数学、知识及多语言问答任务上的效用差异。其意义在于将数据选择从经验驱动推向可复现的实证研究,为理解训练数据与模型能力之间的因果联系奠定方法论基础。
实际应用
在工业级大模型开发流程中,该数据集为数据筛选管线的设计提供了可操作的参照。工程团队可利用这些配置在训练早期进行小规模消融实验,以识别对目标领域最有效的数据选择策略,从而在有限算力下优化预训练或微调的数据配比。对于需要多语言问答、代码生成或数学推理能力的垂直场景,该数据集的分域配置支持按任务类型进行针对性的数据策略验证。此外,其统一的messages字段格式便于直接接入主流训练框架,降低策略迁移的工程成本。
数据集最近研究
最新研究方向
面向大语言模型数据选择与优化领域,该数据集通过整合BBH、Codex、GSM8K、MMLU-Pro及TyDiQA五大基准任务,构建了涵盖多样化采样策略(如LESS-DG、LESS-KNN-KDE、LESS-KNN-Uniform、LESS-RR、LESS-UOT及RDS-RR)的万条样本子集,为探究数据高效利用与模型性能边界提供了系统化实验平台。当前研究聚焦于利用影响力函数、核密度估计与最优传输等理论工具,量化训练样本对模型泛化能力的贡献,进而指导数据剪枝与课程学习。该工作与近期关于数据-centric AI的热点议题紧密呼应,尤其在小样本微调与多任务推理场景下,对降低计算成本、提升模型鲁棒性具有显著意义,推动了数据选择从启发式向理论驱动范式的演进。
以上内容由遇见数据集搜集并总结生成



