遇见数据集

danish-word-problems-v1

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

本数据集(danish-word-problems,v1 版本)是一个用于训练模型解决丹麦语数学应用题(Word Problems)的合成数据集。该数据集由基础程序生成器构建,其数据生成配方包含“混合”(Mixture)方法。它主要用于对大型语言模型进行监督微调(SFT),旨在提升模型解决丹麦语数学文字问题的能力。该数据集的性能通过在 GSM8K[da](丹麦语版)基准测试上的表现进行评估,使用 v1 数据训练的模型在该测试中取得了 4.86% 的准确率。需要注意的是,此 v1 版本已被更新的 v2 版本所取代。v2 版本在 v1 的基础上进行了显著扩展和改进,包括引入了 16 种组合配方(相较于 v1 的 8 种基础类型)、增加了约 30% 的反向推理链以训练方程逆推能力、为每个数学操作符提供了约 10-15 个模板变体以增加表面多样性,并保留了“混合”配方。建议所有新的监督微调任务均使用 v2 版本。

This dataset (danish-word-problems, version v1) is a synthetic dataset designed for training models to solve Danish-language mathematical word problems. It is constructed using a basic program generator with a data generation recipe that includes the Mixture method. The dataset is primarily used for supervised fine-tuning (SFT) of large language models, aiming to enhance their ability to solve Danish mathematical text problems. Its performance is evaluated on the GSM8K[da] (Danish version) benchmark, where models trained with v1 data achieved an accuracy of 4.86%. Note that this v1 version has been superseded by the newer v2 version. The v2 version introduces significant expansions and improvements over v1, including 16 combination recipes (compared to 8 basic types in v1), an increase of approximately 30% in reverse reasoning chains to train equation inversion capabilities, about 10-15 template variations per mathematical operator to enhance surface diversity, and retention of the Mixture recipe. It is recommended that all new supervised fine-tuning tasks use the v2 version.

创建时间:
2026-07-22
原始信息汇总
  • 数据集名称:danish-word-problems-v1
  • 状态:已弃用(DEPRECATED)
  • 替代数据集jensjepsen/danish-word-problems-v2
  • 替代版本新增内容
    • 16种组合式配方(wp_compose),原版本为8种基础类型
    • 反向链(约30%的行),用于训练方程反转
    • 每个运算符的习语库(每个运算符约10-15种模板变体),增加表面多样性
    • 保留了混合作为同级配方
  • 构建方式:仅基于基础程序生成器构建
  • 评估结果:使用v1训练的SFT模型在GSM8K[da]评估中得分为4.86%;v2版本解决了在esperanto-word-problems-v4上的同等差距
搜集汇总
数据集介绍
danish-word-problems-v1 数据集图片
构建方式
该数据集基于程序化生成器构建,专注于丹麦语单词问题,旨在为小规模语言模型提供数学推理训练素材。其生成逻辑围绕八种基础类型展开,通过预定义模板自动生成文本与对应的数学表达式,形成结构化的问题-答案对。数据集以HuggingFace格式存储,便于直接加载与使用。
特点
作为早期版本,该数据集具有基础性与示范性,但已显露出局限性:仅包含八种基础问题类型,缺乏组合式配方与反向链推理样本;每类算子的模板变体数量有限,导致表面多样性不足。据评估,基于该数据集微调的SFT模型在GSM8K[丹麦语]任务上得分仅为4.86%,说明其在复杂推理场景下的表现尚待提升。
使用方法
用户可通过HuggingFace的datasets库加载该数据集,将其作为丹麦语数学推理任务的训练或评测来源。典型使用流程包括使用load_dataset函数读取数据,将文本与答案字段适配至模型输入格式,并基于标准SFT流程进行微调。鉴于其已被标记为过时,建议新项目直接迁移至功能更完善的v2版本以获得更丰富的推理能力和更高性能。
背景与挑战
背景概述
danish-word-problems-v1是一个面向丹麦语数学推理任务的合成数据集,由研究者jensjepsen构建,旨在为低资源语言(如丹麦语)提供类似于GSM8K的数学应用题训练数据。该数据集发布于特定时间节点,其核心研究问题在于如何通过程序化生成方式,弥补丹麦语在自然语言推理领域的数据匮乏,从而推动多语言、低资源场景下的语言模型推理能力研究。作为初始版本,v1为后续迭代奠定了基础,其影响力主要体现在启发了v2版本中复合配方、逆向链等技术改进,并直接关联到esperanto-word-problems系列的数据增强策略,对低资源语言数学推理数据集的设计范式具有重要参考价值。
当前挑战
该数据集面临的挑战主要集中在两方面:一是领域问题层面,丹麦语作为低资源语言,缺乏高质量的数学应用题数据,导致语言模型在丹麦语数学推理任务上表现极差——基于v1训练的SFT模型在GSM8K[da]评估中仅获得4.86%的准确率,凸显了数据稀缺性和语义复杂性带来的瓶颈。二是构建过程中的难题,v1依赖基础程序化生成器,仅包含8种基本操作类型,导致表面形式多样性不足、难以覆盖真实世界问题的复杂性;同时缺乏逆向链和复合配方等结构,限制了模型对深层推理和方程变换的泛化能力,这些缺陷促使了v2版本的演进。
常用场景
经典使用场景
该数据集专为丹麦语语境的数学推理任务设计,常用于训练和评估语言模型在基础算术应用题上的表现。其核心使用场景是构建基于丹麦语的小学级别数学问题集,涵盖加法、减法、乘法、除法等八种基本运算类型,通过程序化生成确保问题结构的多样性与可控性。研究者可利用该数据集微调预训练语言模型,使其掌握从自然语言描述中提取数学逻辑并输出正确答案的能力,尤其在非英语语言模型的数理推理能力评估中具有重要价值。
衍生相关工作
该数据集为后续改进版本提供了基础框架,其直接衍生工作是v2版本(`danish-word-problems-v2`),后者通过引入16种复合运算类型、反向链式问题及每个运算符的约10-15种模板变体,显著提升了问题的表面多样性与训练效果。在方法论层面,该数据集工作启发了针对低资源语言数学推理瓶颈的系统性解决方案,例如通过程序化生成与模板变异策略消除模型对模式记忆的依赖,其经验被迁移至世界语数学问题数据集(`esperanto-word-problems-v4`)的建设中,展示了跨语言适用性。
数据集最近研究
最新研究方向
在当前自然语言处理与数学推理交叠的前沿领域,danish-word-problems-v1作为一项早期尝试,为丹麦语算术推理数据集的开辟奠定了基石。尽管该版本已被官方标记为弃用,其在低资源语言环境下探索结构化词问题生成的意义不可忽视——基于基础程序生成器构建的v1版本,通过SFT模型在GSM8K丹麦语评测集上仅获得4.86%的得分,这一低迷表现恰好揭示了单调配方类型与有限表面多样性对推理泛化能力的显著制约。随后演进出的v2版本,则通过引入组合式配方、逆向推理链及算子专属习语库等创新设计,系统性地解决了v1的局限,这一跃迁不仅呼应了多语言推理评测中数据增强策略的热点需求,更为北欧语系数学语料库的标准化建设提供了可复用的范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务