遇见数据集

gsm8k-indic-cultural

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

GSM8K Indic Cultural Adaptation 是 GSM8K 测试集的文化本地化版本,旨在评估数学推理模型在文化适应问题表述下的鲁棒性。该数据集保留了原始 GSM8K 基准的数学推理逻辑,同时将问题适配到印度语境。数据集包含三个变体:Cultural + Values(文化实体和数值均进行本地化,重新计算中间推理和最终答案)、Cultural Only(仅更改文化实体,保留原问题和答案)、Values Only(仅转换数值和单位,重新计算答案)。每个变体包含 1319 个样本。数据字段包括:index(对应GSM8K测试样例索引)、split(test)、is_cultural(布尔值,指示是否修改文化实体)、augmented_question(文化适配后的问题)、augmented_answer(步骤推理列表)、final_answer(最终数值答案)。构造过程包括:识别文化特定实体(如人名、食物、职业、地点、货币、单位),替换为印度对应的实体,转换货币(1 USD = 87 INR)和单位,重新计算所有受影响的中间步骤和最终答案。该数据集适用于评估数学推理模型、跨文化鲁棒性、文化本地化推理、公平性与偏见分析。

GSM8K Indic Cultural Adaptation is a culturally localized variant of the GSM8K test set, designed to evaluate the robustness of mathematical reasoning models under culturally adapted problem formulations. This dataset retains the mathematical reasoning logic of the original GSM8K benchmark, while adapting all problems to the Indian context. The dataset includes three variants: 1. Cultural + Values: Both cultural entities and numerical values are localized, with intermediate reasoning steps and final answers recalculated; 2. Cultural Only: Only cultural entities are modified, while the original problem and answer are retained; 3. Values Only: Only numerical values and units are converted, with the final answer recalculated. Each variant contains 1319 samples. The dataset fields are as follows: index (corresponding to the index of GSM8K test examples), split (test), is_cultural (a boolean value indicating whether cultural entities have been modified), augmented_question (the culturally adapted question), augmented_answer (a list of step-by-step reasoning), final_answer (the final numerical answer). The construction process of the dataset includes: identifying culture-specific entities such as personal names, foods, occupations, locations, currencies and units, replacing them with corresponding Indian entities, converting currencies (1 USD = 87 INR) and units, and recalculating all affected intermediate steps and final answers. This dataset is suitable for evaluating mathematical reasoning models, cross-cultural robustness, culturally localized reasoning, fairness and bias analysis.

创建时间:
2026-07-29
原始信息汇总

GSM8K Indic Cultural Adaptation 数据集详情

数据集概览

GSM8K Indic Cultural AdaptationGSM8K 测试集的文化本地化版本,旨在评估数学推理模型在文化适应问题表述下的鲁棒性。数据集保留了原始 GSM8K 基准的数学推理逻辑,同时将问题适配至印度语境,包括替换文化特定实体、转换货币和计量单位,并重新计算所有受影响的计算步骤和最终答案。

  • 语言:英语
  • 许可证:MIT
  • 任务类别:问答
  • 来源数据集:GSM8K
  • 标签:数学、推理、鲁棒性、文化适应、评估

数据集变体

数据集包含三个互补的变体,每个变体包含 1,319 条样本,均源自 GSM8K 测试集:

变体 说明
Cultural + Values (cultural_values) 文化实体(如姓名、食物、职业、地点、货币、计量单位)本地化至印度语境,受影响的数值全部重新计算,中间推理步骤和最终答案同步更新
Cultural Only (cultural) 仅修改问题中的文化实体,保留原始叙事和其他上下文信息,中间推理与最终答案保持不变
Values Only (values) 仅转换文化相关的数值(如货币、单位),保留原始叙事和命名实体,推理步骤与最终答案重新计算以保证数学正确性

这些变体可实现文化本地化不同方面的受控评估:Cultural Only 隔离文化变化的影响,Values Only 隔离数值和单位变化的影响,Cultural + Values 衡量文化本地化与数值适应的综合效应。

数据集结构

gsm8k-indic-cultural/ ├── README.md └── data/ ├── cultural_values.jsonl ├── cultural.jsonl └── values.jsonl

每个 JSONL 文件每行包含一个 JSON 对象,示例格式如下:

json { "index": 0, "split": "test", "is_cultural": true, "augmented_question": "Rukminis ducks lay 16 eggs per day...", "augmented_answer": [ "Rukmini sells 16 - 3 - 4 = 9 duck eggs a day.", "She makes 9 × 174 = 1566 rupees every day.", "#### 1566" ], "final_answer": 1566 }

数据字段说明

字段 类型 描述
index 整数 对应 GSM8K 测试样本的索引
split 字符串 数据集划分("test")
is_cultural 布尔值 是否修改了文化实体
augmented_question 字符串 文化适配后的问题
augmented_answer 字符串列表 对应适配问题的逐步推理
final_answer 浮点数 最终数值答案

数据集构建方法

数据集通过对 GSM8K 测试集中的每个样本进行文化适配构建,主要步骤包括:

  1. 识别原始问题中的文化特定实体
  2. 将其替换为合理的印度对应物
  3. 转换文化相关的数值
  4. 重新计算所有受影响的中间计算
  5. 更新最终标准答案以保证数学正确性

文化适配涵盖个人姓名、食物、职业、地点、货币、计量单位等。货币从 USD 转换为 INR,固定汇率为 1 USD = ₹87;计量单位(如磅转千克)在适当时进行转换,所有下游计算和参考答案均重新计算以保持一致性。

预期用途

该数据集适用于以下研究领域:

  • 数学推理模型评估
  • 大型语言模型的跨文化鲁棒性
  • 文化本地化推理基准测试
  • 公平性与偏差分析
  • 推理基准的跨文化评估

局限性

  • 数据集仅来源于 GSM8K 测试集
  • 仅供 评估 使用,不适用于模型训练
  • 文化适配特定于印度语境,不代表印度内部所有地区或文化变体
  • 已尽力保证数学正确性,但仍鼓励用户报告发现的不一致之处

数据集加载

可使用 Hugging Face datasets 库加载:

python from datasets import load_dataset

cultural_values = load_dataset("kiranpradeep/gsm8k-indic-cultural", "cultural_values") cultural = load_dataset("kiranpradeep/gsm8k-indic-cultural", "cultural") values = load_dataset("kiranpradeep/gsm8k-indic-cultural", "values")

引用

使用该数据集时,请引用:

bibtex @misc{gsm8k_indic_2026, title={GSM8K Indic Cultural Adaptation}, author={Kiran Pradeep, Aditya Tomar, Nihar Ranjan Sahoo, Rudra Murthy}, year={2026}, howpublished={Hugging Face Dataset} }

同时请引用原始 GSM8K 论文。

致谢

该数据集是基于 GSM8K 基准的衍生作品,感谢 GSM8K 作者公开提供原始数据集。使用者还应遵守原始 GSM8K 数据集的许可和引用要求。

搜集汇总
数据集介绍
gsm8k-indic-cultural 数据集图片
构建方式
GSM8K Indic Cultural Adaptation 数据集的构建基于对原始 GSM8K 测试集的文化本地化改造,旨在保持数学推理内核的同时,将题目中的文化特定元素(如人名、食物、职业、地点、货币和计量单位)替换为印度背景下的对应实体。构建流程包含识别原始问题中的文化特定实体、替换为贴合印度语境的描述、转换货币(以1美元兑换87卢比的固定汇率)及计量单位,并对所有受影响的中间计算步骤和最终答案进行严格重算,以确保数学正确性。该数据集提供三种变体:cultural_values 同时调整文化实体与数值,cultural 仅更改文化实体而维持原始数值与推理,values 仅转换数值而保留原始叙述,从而实现对不同文化适应层面的独立评估。
特点
该数据集的核心特色在于其精细的变体设计,允许研究者分别考察文化语境变化与数值单位变化对数学推理模型鲁棒性的影响。三个变体均包含1319条从GSM8K测试集衍生的样本,每条样本保留了原始题目的逻辑结构,并提供了调整后的问题、逐步推理链和最终数值答案。数据集明确标注了每个样本是否包含文化修改(is_cultural字段),便于进行对照实验。此外,所有转换均遵循固定的汇率和单位换算规则,确保了数据的可复现性和内部一致性,为跨文化推理能力的基准测试提供了高质量、可多维度拆解的工具。
使用方法
该数据集专为评估而非训练设计,可通过Hugging Face的datasets库便捷加载,用户需指定配置名称(cultural_values、cultural、values)来获取不同变体。典型应用场景包括:比较大型语言模型在原始GSM8K与各文化适应版本上的数学推理准确率,以量化文化因素对模型性能的干扰;结合三种变体进行消融研究,解析文化实体替换与数值转换的独立影响;以及用于公平性分析,探究模型在不同文化背景下的表现差异。加载后,每条记录包含index、split、augmented_question、augmented_answer和final_answer字段,便于直接用于评估脚本或进一步的数据处理。研究者应遵循原始GSM8K的许可协议,并在引用时注明本数据集及其来源。
背景与挑战
背景概述
GSM8K Indic Cultural Adaptation 数据集由 Kiran Pradeep、Aditya Tomar、Nihar Ranjan Sahoo 与 Rudra Murthy 于2026年联合构建,旨在回应大语言模型在数学推理任务中对文化语境敏感性的评估需求。该数据集以经典 GSM8K 测试集为基础,通过系统性地将题目中的文化实体(如人名、食物、职业)与数值体系(如货币、度量衡)本地化为印度语境,并严格重算所有中间步骤与最终答案,从而生成三种可控变体(Cultural Only、Values Only、Cultural Values)。这一设计使得研究者能够独立考察文化替换与数值转换对模型推理鲁棒性的影响,为跨文化推理评估提供了精细化的基准工具,对多语言、多文化背景下的模型公平性研究具有重要推动作用。
当前挑战
该数据集面临的挑战涵盖多个层面。在领域问题层面,现有数学推理基准多基于西方文化语境,模型在应对非西方文化实体与计量单位时易出现性能退化,如何准确量化文化本地化对推理能力的影响成为核心难题。在构建过程中,挑战尤为严峻:需在不改变原始数学逻辑的前提下,逐一识别并合理替换文化特异实体,同时保证数值转换(如 USD 至 INR 的汇率固定为87)后所有计算链的一致性,任何细微疏漏都会导致参考答案错误。此外,变体设计需确保 Cultural Only 保持原数值不变,Values Only 保持原叙事不变,这在实践中需要精细的文本与数值分离处理,加之印度内部文化多样性,单一本地化方案难以全面代表所有区域特征,数据集构建的普适性与精确性平衡构成持续挑战。
常用场景
经典使用场景
GSM8K Indic Cultural Adaptation 数据集作为数学推理与跨文化鲁棒性评估的经典基准,其核心用途在于检验大型语言模型(LLM)在文化本地化问题表述下的推理稳健性。该数据集通过对原始 GSM8K 测试集进行细致的印度语境改编,涉及人名、食物、职业、地点、货币及计量单位的替换,并精确重算所有受影响的计算步骤与最终答案,从而为研究者提供了一个严谨的控制变量实验平台。其独特的三变体设计(文化+数值、纯文化、纯数值)使得研究者能够独立剖析文化实体替换与数值单位转换对模型推理能力的分别影响,是评估模型在多样化文化背景下数学问题解决能力的不可或缺的工具。
实际应用
在实际应用层面,该数据集可作为多语言、多文化环境下智能教育系统、数学辅导工具及自动化评估平台的质量检测基准。例如,在印度本地化的教育科技产品中,用于验证模型能否正确处理卢比货币、公制单位以及本土化人名和场景,从而确保其对印度学生的数学问题提供准确解答。同时,它还能服务于跨文化客服系统、旅游咨询助手等场景,检验模型在面临不同文化背景的数学运算(如汇率换算、单位转换)时的鲁棒性。企业研发团队可利用此数据集在部署前对模型进行文化压力测试,以规避因文化误解导致的错误输出,提升用户体验并减少潜在的经济损失。
衍生相关工作
该数据集的推出激发了多项后续研究,衍生出若干经典工作。其一,它作为跨文化评估的标杆,被用于扩展至其他语言和文化背景,如阿拉伯语、汉语等类似本地化基准的构建,从而系统评估模型在不同文化语境下的推理能力。其二,研究者基于其变体设计,开发了对抗性数据增强技术,旨在通过文化扰动词汇提升训练数据的多样性,增强模型的跨文化泛化能力。其三,该数据集还催生了关于数学推理中文化先验知识影响的探析工作,例如探究模型是否真正理解题目中的文化元素,抑或仅依赖数值模式,进而推动解释性AI研究的发展。此外,它还成为公平性研究的重要工具,用于检测模型在特定文化群体上的表现偏差,为构建无偏、包容性的AI系统提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务