遇见数据集

MU-NLPC/Calc-X_style-instructions

收藏
Hugging Face2023-11-17 更新2024-03-04 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: gsm8k path: data/gsm8k-* - split: ape210k path: data/ape210k-* - split: aqua_rat path: data/aqua_rat-* - split: math_qa path: data/math_qa-* - split: svamp path: data/svamp-* - split: asdiv_a path: data/asdiv_a-* - split: mawps path: data/mawps-* dataset_info: features: - name: template dtype: string - name: weight dtype: float64 splits: - name: gsm8k num_bytes: 1171 num_examples: 11 - name: ape210k num_bytes: 551 num_examples: 5 - name: aqua_rat num_bytes: 769 num_examples: 5 - name: math_qa num_bytes: 765 num_examples: 5 - name: svamp num_bytes: 551 num_examples: 5 - name: asdiv_a num_bytes: 551 num_examples: 5 - name: mawps num_bytes: 551 num_examples: 5 download_size: 16932 dataset_size: 4909 --- # Dataset Card for "Calc-X_instructions" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

配置项: - 配置名称:default 数据文件: - 数据拆分(split):gsm8k 路径:data/gsm8k-* - 数据拆分(split):ape210k 路径:data/ape210k-* - 数据拆分(split):aqua_rat 路径:data/aqua_rat-* - 数据拆分(split):math_qa 路径:data/math_qa-* - 数据拆分(split):svamp 路径:data/svamp-* - 数据拆分(split):asdiv_a 路径:data/asdiv_a-* - 数据拆分(split):mawps 路径:data/mawps-* 数据集信息: 特征: - 字段名:模板(template) 数据类型(dtype):字符串(string) - 字段名:权重(weight) 数据类型(dtype):float64(64位浮点型) 数据拆分详情: - 拆分名称:gsm8k 字节数:1171 样本数:11 - 拆分名称:ape210k 字节数:551 样本数:5 - 拆分名称:aqua_rat 字节数:769 样本数:5 - 拆分名称:math_qa 字节数:765 样本数:5 - 拆分名称:svamp 字节数:551 样本数:5 - 拆分名称:asdiv_a 字节数:551 样本数:5 - 拆分名称:mawps 字节数:551 样本数:5 下载大小:16932 数据集总大小:4909 # 「Calc-X_instructions」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
MU-NLPC
原始信息汇总

数据集概述

数据集配置

  • 默认配置
    • 数据文件路径:
      • gsm8k: data/gsm8k-*
      • ape210k: data/ape210k-*
      • aqua_rat: data/aqua_rat-*
      • math_qa: data/math_qa-*
      • svamp: data/svamp-*
      • asdiv_a: data/asdiv_a-*
      • mawps: data/mawps-*

数据集信息

  • 特征

    • template: 字符串类型
    • weight: 浮点数类型(float64)
  • 拆分

    • gsm8k
      • 字节数: 1171
      • 样本数: 11
    • ape210k
      • 字节数: 551
      • 样本数: 5
    • aqua_rat
      • 字节数: 769
      • 样本数: 5
    • math_qa
      • 字节数: 765
      • 样本数: 5
    • svamp
      • 字节数: 551
      • 样本数: 5
    • asdiv_a
      • 字节数: 551
      • 样本数: 5
    • mawps
      • 字节数: 551
      • 样本数: 5
  • 下载大小: 16932 字节

  • 数据集大小: 4909 字节

搜集汇总
数据集介绍
构建方式
在数学推理与自然语言处理的交叉领域,高质量指令数据的构建对于提升模型的算术能力至关重要。MU-NLPC/Calc-X_style-instructions数据集通过整合多个公开的数学推理基准数据集而成,涵盖GSM8K、APE210k、AQUA_RAT、Math_QA、SVAMP、ASDiv_A及MAWPS等七个经典子集。每个子集被划分为独立的训练分片,原始数据经过统一格式的模板化处理,转化为包含'instruction'字段的结构化指令样本,并赋予相应的权重系数以平衡不同来源的样本分布。
特点
该数据集的显著特点在于其多源异构性所带来的丰富性和平衡性。七个数学推理子集覆盖了从基础算术到复杂应用题的不同难度层级,样本规模从GSM8K的11条到APE210k的5条不等,总数据量虽小却极具代表性。每个样本均以标准化的模板形式呈现,便于下游任务直接调用,同时通过权重字段实现了对各类别样本影响力的精细化调控,为跨领域数学推理研究提供了灵活的数据基础。
使用方法
在应用层面,该数据集可直接通过HuggingFace Datasets库加载,用户只需指定配置名称'default'即可获取包含所有子集的分片数据。加载后的数据集以字典形式提供'template'和'weight'两个字段,前者为指令文本,后者为浮点型权重值。研究者可依据权重字段进行分层采样或损失加权,亦可按需合并或筛选特定子集,以适配不同数学推理场景下的模型训练与评估需求。
背景与挑战
背景概述
在自然语言处理与数学推理的交汇领域,如何让语言模型具备精确的数学计算能力一直是研究热点。MU-NLPC/Calc-X_style-instructions数据集由MU-NLPC团队创建,旨在整合多个数学推理子数据集(如GSM8K、APE210K、AQUA-RAT等)的指令格式,为模型提供统一、多样化的数学问题训练样本。该数据集的核心研究问题在于探索如何通过风格化指令增强模型对数学问题的理解与符号计算能力,从而推动大型语言模型在数学推理任务中的表现。其影响力体现在为多源数学数据的标准化提供了范例,促进了数学推理任务中指令微调方法的系统性研究。
当前挑战
当前数据集面临的核心挑战包括:其一,数学推理任务本身要求模型具备逻辑链条的完整性与数值计算的精确性,而现有模型常因中间步骤缺失或计算误差导致推理失败;其二,数据构建过程中,如何从不同来源(如GSM8K的文本应用题、AQUA-RAT的代数题)中提取并统一指令模板,确保跨数据集风格的兼容性,同时避免格式冲突与语义歧义,成为技术难点。此外,各子数据集样本量不均衡(如GSM8K含11例,而APE210K仅5例),可能影响模型泛化能力,需设计有效的采样或加权策略以缓解分布偏差。
常用场景
经典使用场景
在自然语言处理与数学推理的交叉领域中,Calc-X_style-instructions数据集以其精心设计的指令模板和权重配置,成为训练和评估大语言模型数学推理能力的经典基准。该数据集汇聚了GSM8K、APE210K、AQuA-RAT、MathQA、SVAMP、ASDiv-A、MAWPS等多个广泛使用的数学推理子集,通过统一的指令风格与样本权重,为模型提供多样化的算术与逻辑问题求解训练。研究者常借助该数据集微调模型,使其掌握从自然语言描述中提取数量关系、执行多步计算并生成精确答案的能力,从而在数学推理任务中达到前沿水平。
实际应用
在实际应用中,Calc-X_style-instructions数据集赋能了智能教育辅导、自动化财务分析及科学计算助手等场景。利用该数据集训练的模型能够解析用户输入的自然语言数学问题,提供分步解答并检验逻辑正确性,从而在在线学习平台中充当个性化数学导师。此外,该数据集也支撑了对话式AI系统的数值推理能力,使其在电商定价、物流优化或医疗剂量计算等工业级任务中实现精准决策,显著提升了人机协作的效率与可靠性。
衍生相关工作
基于Calc-X_style-instructions,学术界衍生出多项经典工作,包括指令微调范式下的数学推理增强方法(如Chain-of-Thought蒸馏)、多任务联合训练框架以及对抗性样本生成策略。后续研究进一步拓展了该数据集的应用边界,例如结合强化学习优化模型推理路径,或利用知识图谱补充数学公式背景。这些工作不仅深化了对语言模型数学能力的理解,还催生了诸如MathCoder、Galactica等专门面向科学计算的预训练模型,推动了AI在STEM领域的基础研究突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务