遇见数据集

transZ/efficient_llm

收藏
Hugging Face2023-11-19 更新2024-03-04 收录
官方服务:

资源简介:

该数据集名为Data V4 for NeurIPS LLM Challenge,包含70949个样本,这些样本是从Huggingface收集的,并经过一系列预处理步骤。数据集分为多个类别,包括数学、科学、复杂问答、CNN新闻、Oasst和Dolly等。每个类别下又细分为不同的子数据集,如gsm8k、mmlu、ARC-Challenge等。数据预处理包括数据收集、少样本选择、少样本重排和提示设计等步骤。

This dataset, titled Data V4 for NeurIPS LLM Challenge, consists of 70,949 samples collected from Hugging Face and has undergone a series of preprocessing procedures. The dataset is categorized into multiple groups including mathematics, science, complex question answering, CNN News, Oasst, Dolly, and so on. Each category further includes distinct sub-datasets such as gsm8k, mmlu, ARC-Challenge, and others. The data preprocessing workflow covers steps like data collection, few-shot sample selection, few-shot ranking, and prompt design.

提供机构:
transZ
原始信息汇总

数据集概述

数据集名称

Data V4 for NeurIPS LLM Challenge

许可

MIT

任务类别

  • 文本生成

数据规模

  • 100K<n<1M

数据集组成

数据集包含70949个样本,具体分布如下:

数学

  • 样本数:1273
  • 来源:
    • gsm8k
    • math_qa
    • math-eval/TAL-SCQ5K
    • TAL-SCQ5K-EN
    • meta-math/MetaMathQA
    • TIGER-Lab/MathInstruct

科学

  • 样本数:42513
  • 来源:
    • lighteval/mmlu - all, "split": auxiliary_train
    • lighteval/bbq_helm - all
    • openbookqa - main

复杂问答

  • 样本数:2940
  • 来源:
    • ARC-Challenge
    • ARC-Easy
    • piqa
    • social_i_qa
    • Muennighoff/babi
    • Rowan/hellaswag

复杂问答1

  • 样本数:2060
  • 来源:
    • medmcqa
    • winogrande_xl
    • winogrande_debiased
    • boolq
    • sciq

CNN

  • 样本数:2787
  • 来源:
    • cnn_dailymail - article - highlights, version 3.0.0

Oasst

  • 样本数:12771
  • 来源:
    • OpenAssistant/oasst1

Dolly

  • 样本数:6605
  • 来源:
    • databricks/databricks-dolly-15k

数据预处理

所有数据经过以下预处理步骤:

  1. 数据收集:使用prepare_data/select_data.py脚本,采用sentence-transformers/all-mpnet-base-v2Fast Community Detection进行数据过滤。
  2. 每个样本最多获取5个示例:使用prepare_data/few_shot_sample.py脚本。
  3. 重新排列数据为少数示例样本:使用prepare_data/fewshot_to_prompt.py脚本。
  4. 设计提示数据:使用prepare_data/prompt_design脚本,最终生成数据。
搜集汇总
数据集介绍
构建方式
该数据集专为NeurIPS LLM Challenge设计,汇聚了来自Huggingface平台的70949个样本。其构建过程遵循一套严谨的预处理流程:首先,利用sentence-transformers/all-mpnet-base-v2模型结合Fast Community Detection算法对原始数据进行过滤筛选,确保样本质量;其次,为每个样本抽取至多五个示例,形成few-shot结构;随后,将这些样本重组为few-shot格式;最后,通过精心设计的提示模板进行数据转换,得到最终数据集。来源涵盖数学、科学、复杂问答及对话等多个领域,如gsm8k、MMLU、ARC-Challenge及OpenAssistant等。
特点
数据集以文本生成为核心任务,规模介于10万至100万之间,展现出多领域融合的鲜明特点。数学子集包含1273个样本,科学子集高达42513个,覆盖MMLU、BBQ等基准;复杂问答部分整合了ARC、PIQA等2940个样本,另有2060个来自MedMCQA、BoolQ等。此外,CNN摘要、Oasst对话及Dolly指令数据分别贡献2787、12771和6605个样本。这种异构数据组合增强了模型的泛化能力,而基于社区检测的过滤机制确保了数据的高代表性与低冗余性。
使用方法
数据集可直接用于文本生成模型的训练与评估,尤其适用于few-shot场景。用户可通过HuggingFace Datasets库加载,并参考配套GitHub仓库中的预处理脚本进行自定义调整。推荐将数据按任务类型划分,例如将数学与科学子集用于知识推理任务,复杂QA子集用于多步推理,对话与指令数据则适用于微调对话模型。使用时需注意数据已预设few-shot示例,可直接作为输入输出对,配合标准交叉熵损失函数进行训练,也可根据需求调整提示模板以适配不同模型架构。
背景与挑战
背景概述
在大规模语言模型蓬勃发展的时代背景下,数据质量与多样性成为决定模型性能的关键因素。transZ/efficient_llm数据集由研究团队于2023年构建,旨在为NeurIPS LLM挑战赛提供高效训练数据。该数据集汇聚了来自HuggingFace平台的70,949个样本,涵盖数学、科学、复杂问答及新闻摘要等多元领域,其设计初衷在于通过精心筛选与结构化处理,提升语言模型在推理与知识应用上的表现。研究团队借助句子嵌入与社区检测技术进行数据过滤,并采用少样本学习范式重组样本,显著增强了数据集的实用性与代表性,为后续高效语言模型的研究奠定了坚实基础。
当前挑战
该数据集面临的核心挑战在于如何平衡数据广度与深度,以应对语言模型在复杂推理任务中的泛化瓶颈。具体而言,数学与科学类样本虽覆盖广泛,但部分子集如TAL-SCQ5K的标注质量与难度分布不均,可能影响模型推理的稳定性。构建过程中,数据过滤依赖的Fast Community Detection算法对超参数敏感,导致冗余或噪声样本的剔除不够彻底。此外,少样本采样策略在跨领域知识迁移时易引入偏差,限制了模型对长尾问题的适应能力。这些挑战共同指向了高效数据构建与模型鲁棒性之间的微妙平衡。
常用场景
经典使用场景
transZ/efficient_llm 数据集专为大型语言模型的高效微调与推理挑战而设计,其经典使用场景聚焦于NeurIPS LLM Challenge中的少样本学习任务。该数据集整合了来自Huggingface的七万余条高质量样本,涵盖数学推理(如gsm8k、MetaMathQA)、科学知识(如MMLU、BBQ)以及复杂问答(如ARC-Challenge、HellaSwag)等多元领域,通过预设的少样本采样与提示工程流程,为评估模型在有限数据下的泛化能力提供了标准化基准。研究者可借助该数据集系统性地探索参数高效微调策略,例如LoRA或Adapter方法,从而在保持性能的同时显著降低计算开销。
衍生相关工作
该数据集催生了一系列聚焦于高效微调与少样本学习的前沿工作。例如,基于其预处理流程,研究者提出了动态少样本采样算法,通过语义相似度动态调整提示示例的组成;同时,针对其数学推理子集,衍生出结合链式思维与参数高效微调的混合方法,如将LoRA与CoT提示相结合以提升复杂问题求解的准确性。此外,数据集中科学知识部分还被用于验证新型知识蒸馏框架,通过多教师集成策略改善小型模型的领域覆盖度。这些工作共同推动了从模型中心向数据中心的范式转变,强调了结构化预处理与任务适配在高效LLM研究中的核心地位。
数据集最近研究
最新研究方向
在大型语言模型(LLM)领域,数据质量与多样性成为提升模型效率与泛化能力的前沿焦点。transZ/efficient_llm 数据集应运而生,融合了数学推理、科学知识、复杂问答、新闻摘要及对话指令等多源数据,并采用社区检测与语义嵌入技术进行精细筛选,以少量高质量样本(约7万条)驱动高效训练。该数据集紧密关联 NeurIPS LLM Challenge,旨在探索如何在有限数据预算下实现模型性能突破,回应了当前业界对数据效率与计算资源优化的高度关注。其预处理流程强调少样本学习与提示设计,为研究数据蒸馏、课程学习及领域自适应提供了标准化基准,对推动低资源场景下的 LLM 部署具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务