遇见数据集

gsm8k-paraphrase-deepseek

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

GSM8K重述变体数据集是基于GSM8K数学问题测试集构建的消融实验数据集,使用DeepSeek-v4-flash模型生成多种重述变体。该数据集旨在研究模型对数学问题的理解和推理能力,特别是在面对重述问题或推理链时的表现。数据集包含四个配置:pq配置包含DeepSeek重述的问题和原始GSM8K答案;pa配置包含原始GSM8K问题和DeepSeek重述的推理链;pqa配置包含DeepSeek重述的问题和推理链;pq_complement配置包含重述问题和原始答案,覆盖测试集剩余部分。每个样本包含三个字段:row_idx(在原始GSM8K测试集中的索引,0-1318)、question(问题文本,在pq、pqa、pq_complement中为重述版本,在pa中为原始版本)、answer(推理链文本,以#### N结尾,其中N为最终答案)。数据集总规模为1319个样本,其中前三个配置各包含660个样本(来自污染训练集的相同子集),第四个配置包含659个样本(剩余部分)。该数据集适用于数学问题求解、文本生成、问答系统等任务,可用于评估模型对问题重述的鲁棒性和推理能力。

The GSM8K rephrasing variant dataset is an ablation experiment dataset constructed based on the GSM8K math problem test set, using the DeepSeek-v4-flash model to generate multiple rephrasing variants. This dataset aims to study the models understanding and reasoning capabilities for math problems, especially when faced with rephrased questions or reasoning chains. The dataset includes four configurations: the pq configuration contains DeepSeek-rephrased questions and original GSM8K answers; the pa configuration contains original GSM8K problems and DeepSeek-rephrased reasoning chains; the pqa configuration contains DeepSeek-rephrased questions and reasoning chains; and the pq_complement configuration contains rephrased questions and original answers, covering the remaining part of the test set. Each sample contains three fields: row_idx (index in the original GSM8K test set, 0-1318), question (question text, rephrased version in pq, pqa, pq_complement, and original version in pa), and answer (reasoning chain text, ending with #### N, where N is the final answer). The total dataset size is 1319 samples, with the first three configurations each containing 660 samples (from the same subset of the contaminated training set), and the fourth configuration containing 659 samples (the remaining part). This dataset is suitable for tasks such as math problem-solving, text generation, and question-answering systems, and can be used to evaluate the robustness and reasoning capabilities of models in response to question rephrasing.

创建时间:
2026-06-03
原始信息汇总

数据集概述:GSM8K Paraphrase Variants (DeepSeek-v4-flash)

基本信息

  • 语言:英语
  • 许可证:MIT
  • 任务类别:文本生成、问答
  • 标签:数学、GSM8K、释义、污染、捷径评估
  • 数据集大小:1,000 < n < 10,000 条
  • 数据集名称:GSM8K paraphrase variants (DeepSeek-v4-flash)

数据集结构与配置

该数据集包含 4 个配置,每个配置包含训练集,基于 GSM8K 测试集(共 1319 条数据)的子样本构建,子样本通过 random.Random(42).sample(range(1319), 660) 抽取。

配置名称 问题来源 答案来源 训练集行数 覆盖内容
pq DeepSeek 释义 原始 GSM8K 答案 660 660 条污染子样本
pa 原始 GSM8K 问题 DeepSeek 释义推理链 660 660 条污染子样本
pqa DeepSeek 释义 DeepSeek 释义推理链 660 660 条污染子样本
pq_complement DeepSeek 释义 原始 GSM8K 答案 659 剩余 659 条保留项(补集)
  • pqpq_complement 的并集可重构完整的 GSM8K 测试集(1319 条)。

数据字段

每条数据包含以下字段:

字段 类型 含义
row_idx int 在 openai/gsm8k 测试集中的索引(0-1318)
question str 问题文本(在 pqpqapq_complement 中为释义版本,在 pa 中为原始版本)
answer str 推理链后接 `

N` 格式的答案 |

构建方法

  1. 从 GSM8K 测试集中随机抽取 660 条子样本,与 M2 混合污染训练集一致,剩余 659 条作为 pq_complement 配置。
  2. 使用 DeepSeek deepseek-v4-flash 模型对子样本进行:
    • 问题释义:重述问题,保留数字和正确答案。
    • 答案释义(仅 papqa):重述推理链,保留所有算术,以文字 The answer is N. 结尾。
  3. 将答案重新格式化为 `

N 后缀,以匹配 openai/gsm8k 格式。原始 GSM8K 答案中的计算标签(<<...>>`)被移除。

  • pqpapqa 配置通过 api.deepseek.com 释义;pq_complement 通过阿里云 Dashscope OpenAI 兼容端点释义(同样使用 deepseek-v4-flash 模型)。

引用与许可证

  • 继承 openai/gsm8k 的 MIT 许可证。
  • 引用时需注明:
    • openai/gsm8k 为原始测试集。
    • DeepSeek 为释义模型(deepseek-v4-flash)。
搜集汇总
数据集介绍
gsm8k-paraphrase-deepseek 数据集图片
构建方式
该数据集基于GSM8K测试集构建,旨在通过变体改写评估模型对数学推理任务的鲁棒性。首先,从GSM8K测试集的1319个样本中,使用固定随机种子采样出660个样本构成污染子集,剩余659个样本作为补集。随后,利用DeepSeek-v4-flash模型对问题与推理链进行独立改写:问题改写保留原始数值与答案,推理链改写则保留所有算术步骤并以统一格式结尾。最终,将改写后的内容重构为与openai/gsm8k标准格式一致的数据结构,形成四个配置子集。
特点
该数据集的核心特点在于其精细化的变体设计。四个配置子集分别覆盖了仅改写问题、仅改写推理链、同时改写两者以及补集改写,实现了对模型在数学推理任务中不同维度泛化能力的系统性评估。每个样本均保留原始索引,便于与GSM8K测试集进行交叉比对。此外,数据集的构建过程严格控制了改写模型的版本与接口来源,确保了改写的标准化与可复现性,为测试集污染检测与捷径评估提供了可靠基准。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,按配置名称指定所需子集。加载后,每条数据包含row_idx、question和answer三个字段,其中row_idx对应GSM8K测试集原始索引,question与answer分别为改写后的问题与答案。该数据集可直接用于评估模型在数学推理任务中的表现,通过对比不同配置下的性能差异,分析模型对问题表述变化与推理链改写的敏感程度,进而识别潜在的捷径学习行为。
背景与挑战
背景概述
GSM8K-paraphrase-deepseek数据集由研究者于近期构建,旨在深入探究数学推理任务中大语言模型对数据污染的鲁棒性。该数据集以经典的GSM8K数学问题集为基础,通过DeepSeek-v4-flash模型对测试集中的题目和推理链进行同义改写,生成了包含660个污染子样本和659个保留样本的多组变体。其核心研究问题在于评估模型在面对表面形式变化时是否依赖记忆而非推理,为可信评估方法学提供了关键基准。该数据集因其精细的消融实验设计和对大模型数学推理能力评估的深刻洞察,在自然语言处理领域内迅速获得关注,尤其是在模型鲁棒性与泛化性研究方面具有重要影响力。
当前挑战
该数据集所针对的核心挑战在于缓解大语言模型在数学推理任务中的捷径学习与数据污染问题。传统基准测试如GSM8K虽可评估数学能力,但模型可能通过记忆训练集分布中的模式而非真正推理来作答,导致评估失真。构建过程中,研究者面临精确控制改写质量的挑战,需确保DeepSeek-v4-flash生成的同义表达在保留数值与计算步骤完整性的同时,不引入额外语义偏差。此外,平衡污染子样本与保留样本的分布,避免因改写带来的数据泄露或评价指标扭曲,也是设计此类评估数据集时的关键难题。
常用场景
经典使用场景
在自然语言处理与数学推理的交叉领域中,GSM8K-Paraphrase-DeepSeek数据集作为一项精巧的变体设计,被广泛用于评估大语言模型在数学应用题上的鲁棒性与泛化能力。其核心范式在于通过DeepSeek模型对原始GSM8K测试集中的问题(Question)与推理步骤(Answer)进行独立或联合的语义改写,从而构建出四种对照条件:仅问题改写(pq)、仅答案改写(pa)、两者均改写(pqa)以及保留问题改写的补全集(pq_complement)。研究者借此可系统性地剖析模型是否真正理解了数学逻辑,抑或仅依赖于问题表面表述的捷径进行作答,为衡量模型对语义变异的容忍度提供了精确的量化工具。
实际应用
在实际应用中,该数据集为教育科技与智能辅导系统的发展提供了坚实的评测基础。对于构建能够自适应解释数学题目的AI导师,模型必须对同一数学概念的不同表述方式保持稳定的理解力,而非僵化地匹配特定句式。通过在这一数据集上进行的压力测试,开发者能够识别出模型在语义泛化上的薄弱环节,进而针对性地优化模型结构或训练策略。此外,该数据集也被用于安全评估场景,通过检测模型在面对对抗性改写或分布外输入时的表现,确保在金融计算、自动化解题等高风险任务中,模型能够输出可靠且一致的数学答案,避免了因表面语义变化带来的误判风险。
衍生相关工作
该数据集的诞生与发展,引发了多项富有影响力的后续研究工作。其中最直接的是将这一改写评估范式拓展至其他数学基准如MATH或SVAMP,形成了跨数据集的鲁棒性测试套件。在此基础上,研究者提出了基于语义不变性的对抗训练方法,利用此数据集的pq与pqa配置作为训练样本,显著提升了模型在未见改写上的泛化能力。此外,有工作借鉴了其污染子集划分策略,深入分析了模型在训练阶段接触目标测试集比例与最终泛化性能之间的量化关系,为数据泄漏检测技术提供了实证依据。这些工作共同编织了一张围绕语义鲁棒性评估的研究网络,确立了该数据集在可信自然语言处理领域中的基石地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务