遇见数据集

typo-results

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

该数据集是一个用于评估语言模型在数学推理任务中对拼写错误鲁棒性的基准测试集,基于GPQA和GSM8K数据集构建,包含多种配置变体。核心数据包括原始数学问题(clean_question)、故意引入特定比例拼写错误的问题(typo_question,存在于部分配置)、提示词(prompt)、标准答案(gold_answer)以及语言模型生成的答案(generation)、推理过程(reasoning)和最终答案文本(final_answer_text)。此外,数据集还记录了模型生成过程的详细元数据,如提示令牌数(n_prompt_tokens)、生成令牌数(n_gen_tokens)、生成成本(cost_usd)和延迟(latency_s)。部分配置专门针对拼写错误分析,提供了错误类型统计字段,如目标真实单词比例(target_real_ratio)、实际真实单词比例(real_ratio)、总错误数(num_total)、真实单词错误数(num_real)、非单词错误数(num_nonword)以及使用的拼写错误技术列表(typo_techniques)。数据集包含20个配置,主要分为clean(无拼写错误)和typo(含拼写错误)两大类,其中typo类配置通过名称中的数字(如typo25, typo50, typo75和real10, real40, real70)表示拼写错误的比例和真实单词在错误中的比例。所有配置仅包含测试集(test),样本数量为198(针对gpqa_clean)或500(针对gsm8k相关配置)。该数据集适用于研究语言模型的数学推理能力、对输入噪声(特别是拼写错误)的鲁棒性、模型生成效率(成本与延迟)以及错误分析。

This dataset is a benchmark for evaluating the robustness of large language models (LLMs) to spelling errors in mathematical reasoning tasks. It is built upon the GPQA and GSM8K datasets and includes multiple configuration variants. The core data consists of: original mathematical questions (clean_question), questions with intentional spelling errors introduced at a specified proportion (typo_question, available in some configurations), prompts, gold standard answers (gold_answer), model-generated answers (generation), reasoning processes (reasoning), and final answer texts (final_answer_text). Additionally, the dataset records detailed metadata from the model generation process, including the number of prompt tokens (n_prompt_tokens), the number of generated tokens (n_gen_tokens), generation cost (cost_usd), and latency (latency_s). Some configurations are dedicated to spelling error analysis, providing error type statistical fields such as the proportion of target real words (target_real_ratio), actual real word proportion (real_ratio), total number of errors (num_total), number of real word errors (num_real), number of non-word errors (num_nonword), and the list of applied spelling error techniques (typo_techniques). The dataset contains 20 configurations, which are primarily categorized into two groups: "clean" (no spelling errors) and "typo" (with spelling errors). The "typo" configurations may indicate the proportion of spelling errors and the proportion of real words in errors via the numbers in their names, such as typo25, typo50, typo75, real10, real40, and real70. All configurations only include the test split, with the number of samples being 198 for gpqa_clean configurations or 500 for GSM8K-related configurations. This dataset is suitable for research on the mathematical reasoning capabilities of language models, their robustness to input noise (particularly spelling errors), model generation efficiency (cost and latency), and error analysis.

创建时间:
2026-07-24
原始信息汇总

数据集概述

该数据集名为 typo-results,旨在研究提示中引入拼写错误(typo)对语言模型推理能力的影响。数据集包含多个配置(config),每个配置对应不同的数据集来源、错误类型和参数设置。

数据集构成

数据集主要包含两大类子集,分别基于 GPQAGSM8K 两个原始数据集构建。

  1. GPQA 干净数据(gpqa_clean)

    • 样本数量: 198
    • 数据拆分: 仅包含测试集(test),大小为 9.81 MB
    • 特点: 包含干净的原始问题(clean_question),没有拼写错误版本的题型(typo_question 为 null)。
  2. GSM8K 数据

    • 这是该数据集的主体,包含多种变体,用于模拟不同类型的拼写错误。所有 GSM8K 配置的测试集均为 500 个样本。
    • 干净数据(gsm8k_clean): 不包含拼写错误,作为基线。
    • 拼写错误数据: 配置名称遵循 gsm8k_typo{error_percentage}_real{real_word_ratio} 的格式。
      • error_percentage: 错误量,有 25%、50%、75% 三档。
      • real_word_ratio: 有意义的拼写错误(即错误后仍为真实单词)的目标比例,有 10%、40%、70% 三档。
      • 例如 gsm8k_typo25_real10 表示 25% 的单词有拼写错误,其中 10% 的错误结果是真实单词。
    • 20000 变体: 部分配置带有 _20000 后缀(如 gsm8k_typo25_real10_20000),其测试集同样为 500 个样本,但数据规模更大。

共有特征

所有配置均包含以下字段:

  • dataset: 源数据集名称(如 "gpqa" 或 "gsm8k")。
  • config: 配置名称。
  • variant: 变体描述。
  • idx / sample_idx: 样本索引。
  • clean_question: 原始、没有错误的提问。
  • typo_question: 包含拼写错误的提问(对于干净数据此为 null)。
  • prompt: 输入给模型的完整提示。
  • gold_answer: 正确答案。
  • generation: 模型生成的原始输出。
  • reasoning: 模型的推理过程。
  • final_answer_text: 模型最终输出的答案文本。
  • n_prompt_tokens / n_gen_tokens: 提示和生成的 token 数量。
  • cost_usd / latency_s: 运行的成本(美元)和延迟(秒)。

拼写错误数据特有的特征

部分 GSM8K 配置包含以下额外字段:

  • target_real_ratio / real_ratio: 有意义的拼写错误的目标比例和实际比例。
  • num_total / num_real / num_nonword: 总错误数量、有意义的错误数量和非单词错误数量。
  • typo_techniques: 列表中存储了生成这些拼写错误所使用的技术。
  • Record ID: GPQA 数据集中每条记录的唯一标识符。

总结

该数据集是一个用于评测语言模型对拼写错误鲁棒性的 benchmark。它提供从干净到不同程度、不同类型拼写错误的多种数据配置,并包含模型的推理过程和最终输出,便于进行深入分析。数据总量从数 MB 到 10 MB 不等,主要用于测试和验证。

搜集汇总
数据集介绍
typo-results 数据集图片
构建方式
该数据集基于GSM8K与GPQA两大数学推理基准构建,通过系统化地注入拼写错误(typo)来生成变体。构建过程遵循预设的拼写错误比例(如25%、50%、75%)与真实词汇错误比例(real ratio,如10%、40%、70%),使用多种拼写错误技术(typo_techniques)对原始清洁文本进行扰动,生成对应的typo_question字段。每个配置均保留原始清洁文本(clean_question)及标准答案(gold_answer),并记录模型推理过程、生成结果及成本、延迟等元数据。数据规模覆盖198至500条样本,并包含以20000为后缀的大规模版本。
特点
该数据集的核心特色在于其精细控制的拼写错误注入机制,通过调节错误比例与真实词汇错误率,模拟现实世界中用户输入含拼写错误的多样性场景。每个样本同时提供清洁与带错的文本对,便于对比分析。丰富的元数据字段(如推理链reasoning、提示词token数、生成耗时等)支持对模型鲁棒性进行多维度评估。此外,数据集覆盖不同数学主题(GSM8K与GPQA),为研究拼写错误对推理能力的影响提供了标准化的测试平台。
使用方法
研究者可通过HuggingFace Datasets库加载该数据集,并依据config_name选择特定错误比例的配置。典型用法包括:1) 将typo_question作为输入,评估模型在含拼写错误场景下的推理准确率;2) 对比clean_question与typo_question的模型输出,分析错误注入对推理质量的影响;3) 利用cost_usd与latency_s字段衡量模型在错误输入下的计算效率。数据集可直接用于构建鲁棒性测试基准或作为数据增强的验证集。
背景与挑战
背景概述
typo-results数据集诞生于大型语言模型(LLM)推理鲁棒性研究迅速发展的背景下。随着以GPT-4为代表的大模型在数学推理任务(如GSM8K和GPQA)中展现出卓越性能,研究者逐渐意识到这些模型在面对输入中的拼写错误(typo)时可能表现出脆弱性。该数据集由相关领域的研究团队创建,旨在系统性地评估并剖析LLM在含拼写错误的数学问题上的表现。通过构建包含干净问题与多种类型拼写错误的对照样本,typo-results为探究模型推理的鲁棒性提供了宝贵的资源,对理解LLM在实际应用中的局限性与改进方向具有重要意义。
当前挑战
该数据集所解决的领域核心挑战在于揭示并量化LLM在变量拼写输入下的推理退化现象。具体挑战包括:1)问题领域挑战——拼写错误作为真实场景中常见的噪声形式,常导致模型在GSM8K和GPQA等数学推理任务上性能骤降,然而先前缺乏系统性的、多维度(错误比例、类型)的评估基准;2)数据构建挑战——需要精准控制拼写错误的注入策略(如键盘误触、同音替代等),并平衡“真实单词”与“非单词”错误的比例(如real10/40/70设置),从而确保数据能真实模拟人类输入错误且不影响问题可解性,同时还需记录详尽的模型生成过程与成本消耗信息,以支撑后续分析。
常用场景
经典使用场景
在自然语言处理与大规模语言模型的研究浪潮中,typo-results数据集专注于评估模型对输入文本中拼写错误的鲁棒性。其经典使用场景涵盖在GSM8K和GPQA等基准测试上,通过注入不同比例(25%、50%、75%)和类型(真实词错误与非词错误)的拼写错误,系统性地检验语言模型的数学推理与问答能力在面对输入噪声时的表现。研究者常借此比较不同模型在清洁与含错输入下的性能差异,从而揭示模型在现实非理想输入中的脆弱性。
解决学术问题
该数据集着力于解答一个关键学术问题:大规模语言模型在输入包含拼写错误时,其推理与生成能力是否会显著退化,以及退化的程度与错误类型和比例之间的关联。通过提供多层级、细粒度的错别字扰动样本,typo-results使学者能够量化模型对表面形式变化的敏感度,推动对模型鲁棒性的系统性评估。这一工作的意义在于揭示了当前模型在应对真实世界语言噪声时的局限性,为构建更稳健的自然语言处理系统提供了重要的实证基础。
衍生相关工作
typo-results数据集的出现催生了一系列围绕语言模型输入鲁棒性的后续研究。不少工作基于该数据集的扰动设计,深入探究了大模型在链式推理过程中受拼写错误影响的具体机制,并尝试通过对抗训练、数据增强或引入纠错前缀等方式来提升模型的容错能力。此外,该数据集也推动了针对不同语言和复杂拼写错误(如语境相关的真实词错误)的基准构建,拓展了鲁棒性评估的维度和深度,成为该领域不可或缺的测试工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务