遇见数据集

Turkce-istatistik-benchmark

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

Türkçe İstatistik Benchmark(土耳其语统计基准)是一个专门用于评估微调后语言模型在土耳其语统计推理任务上真实性能的数据集。该数据集包含100个问题-答案对,这些数据在模型微调过程中绝对未被使用,旨在通过模型在训练期间未见过的统计问题来准确衡量其泛化能力。数据集的构建分为两个阶段:37个问题来自主数据集(400个问题)的预训练分层抽样,另外63个问题是为了使基准在统计上更具可靠性而后添加的,同时保持了主数据集中各模块的比例。所有100个问题均经过验证,确保与主训练数据及其他问题无重叠。数据集涵盖7个统计模块:统计学基础、描述性统计、概率、概率分布、抽样与估计、假设检验、回归与相关性。基准中的问题分布严格遵循主数据集的模块比例(每个模块偏差在±1%以内),使得这100个问题成为400个问题主数据集的具有代表性的缩小样本。数据集中包含两个字段:soru(用户问题)和referans_cevap(参考答案,由人工准备的无思维链的最终解释)。问题难度分布为:简单18%、中等53%、高级29%;问题类型分布为:概念性44%、解释性33%、陷阱/误解23%。该数据集适用于文本生成和问答任务,特别是作为土耳其语统计推理能力的评估基准。评估方法基于使用paraphrase-multilingual-mpnet-base-v2模型生成的嵌入,计算模型答案与参考答案之间的余弦相似度得分。

Türkçe İstatistik Benchmark (Turkish Statistics Benchmark) is a dataset specifically designed to evaluate the real-world performance of fine-tuned language models on Turkish statistical reasoning tasks. It contains 100 question-answer pairs that were absolutely not used during model fine-tuning, aiming to accurately measure the generalization ability of models through statistical problems unseen during training. The dataset construction is divided into two phases: 37 questions were sampled from the main dataset (400 questions) through pre-training stratified sampling, and an additional 63 questions were added later to make the benchmark statistically more reliable, while maintaining the proportions of the modules in the main dataset. All 100 questions have been verified to ensure no overlap with the main training data or other questions. The dataset covers 7 statistical modules: Basics of Statistics, Descriptive Statistics, Probability, Probability Distributions, Sampling and Estimation, Hypothesis Testing, and Regression and Correlation. The distribution of questions in the benchmark strictly follows the module proportions of the main dataset (with a deviation of ±1% per module), making these 100 questions a representative reduced sample of the 400-question main dataset. The dataset includes two fields: soru (user question) and referans_cevap (reference answer, which is a final explanation prepared manually without a chain of thought). The difficulty distribution of questions is: easy 18%, medium 53%, advanced 29%; the question type distribution is: conceptual 44%, explanatory 33%, trap/misconception 23%. This dataset is suitable for text generation and question-answering tasks, particularly as an evaluation benchmark for Turkish statistical reasoning capabilities. The evaluation method is based on embeddings generated using the paraphrase-multilingual-mpnet-base-v2 model, calculating the cosine similarity score between model answers and reference answers.

创建时间:
2026-07-25
原始信息汇总

数据集名称

  • Türkçe İstatistik Benchmark(土耳其语统计基准测试集)

许可证

  • CC-BY-SA-4.0

语言

  • 土耳其语(tr)

任务类别

  • 文本生成(text-generation)
  • 问答(question-answering)

标签

  • 统计(statistics)
  • 推理(reasoning)
  • 土耳其语(turkish)
  • 基准测试(benchmark)
  • 评估(evaluation)

数据集规模

  • 样本数量:100条(小于1K)
  • 训练集大小:189,692字节
  • 下载大小:110,398字节

数据集结构

  • 特征conversations(包含contentrole字段,imagesthinkingtool_calls为null)
  • 分割:仅含train分割,共100个样本

数据内容

    • soru:用户问题
    • referans_cevap:参考/标准答案(由人类准备,不含思维链)

数据来源与构建

  • 基于父数据集Toivo0/Turkce-istatistik-reasoning(400个样本),微调过程中绝对未使用
  • 构建分两阶段:
    1. 37题:从父数据集中按模块分层抽样预留。
    2. 63题:额外生成,保持模块比例,增强统计可靠性。
  • 不重复验证:100题与父数据集及彼此间无重叠。

覆盖范围(7个统计模块)

| 模块编号 | 主题 | 父集题数(400) | 本基准题数(100) | |---|---:|---:| | 1 | 统计学基础 | 51 | 12 | | 2 | 描述性统计 | 50 | 13 | | 3 | 概率 | 55 | 14 | | 4 | 概率分布 | 51 | 13 | | 5 | 抽样与估计 | 59 | 15 | | 6 | 假设检验 | 89 | 22 | | 7 | 回归与相关性 | 45 | 11 | | 总计 | | 400 | 100 |

  • 模块比例与父集一致(每模块偏差≤±1%),是父集的代表性缩小版本。

难度分布

  • 简单:18%(18题)
  • 中等:53%(53题)
  • 高级:29%(29题)

问题类型分布

  • 概念性:44%(44题)
  • 解释性:33%(33题)
  • 陷阱/误区:23%(23题)

使用方式

python from datasets import load_dataset benchmark = load_dataset("Toivo0/Turkce-istatistik-benchmark", split="train")

评估方法

  • 使用paraphrase-multilingual-mpnet-base-v2生成答案与参考答案的嵌入向量,计算余弦相似度评分。
  • 对于生成思维链(<think>...</think>)的模型,仅评分</think>之后的最终回答。
  • 注意:语义相似度度量意图接近性,不保证事实正确性,建议人工检查部分样本。
搜集汇总
数据集介绍
Turkce-istatistik-benchmark 数据集图片
构建方式
该土耳其语统计推理基准数据集(Turkce-istatistik-benchmark)由100道精心筛选的问答对构成,旨在评估微调后模型在未曾见过问题上的真实性能。其构建过程分为两个阶段:首先,从包含400道题目的源数据集中,基于统计模块比例进行分层抽样,预留出37道题目;随后,为增强基准的统计可靠性,额外生成63道题目,并严格保持与源数据集各模块比例的接近。所有100道题目均经过验证,确保与源训练数据及彼此之间无任何重叠。
特点
数据集覆盖七个统计模块,包括统计学基础、描述性统计、概率论、概率分布、抽样与估计、假设检验以及回归与相关,各模块题目比例与源数据集高度一致(偏差不超过±1%),可视为源数据的缩微代表样本。难度分布上,简单题占18%,中等题占53%,进阶题占29%。题目类型涵盖概念题(44%)、解释题(33%)与陷阱/谬误题(23%),全面考验模型的理解、推理与辨别能力。
使用方法
用户可通过Hugging Face Datasets库便捷加载该数据集,使用`load_dataset("Toivo0/Turkce-istatistik-benchmark", split="train")`命令即可获取训练分割。评估时,模型回答与参考答案之间的语义相似度通过`paraphrase-multilingual-mpnet-base-v2`模型生成的嵌入向量计算余弦相似度来量化。对于生成了思维链内容的模型,评估仅考虑闭合标签后的最终答案部分,以确保公平比较。需注意,语义相似度衡量的是答案在含义上的接近程度,而非事实准确性,建议用户结合实际案例进行人工复核。
背景与挑战
背景概述
在自然语言处理领域,针对特定学科知识推理能力的评估基准日益受到关注,尤其对于低资源语言如土耳其语,相关资源稀缺。Turkce-istatistik-benchmark数据集由研究人员Toivo0于近年创建,旨在测试经过微调的大型语言模型在土耳其语统计学推理任务上的真实表现。该基准包含100个精心设计的问题-答案对,涵盖统计学基础、描述性统计、概率、概率分布、抽样与估计、假设检验、回归与相关等七大模块,各模块比例与原始训练数据集严格一致,确保评估的均衡性与代表性。其核心研究问题聚焦于模型在未见过的统计问题上的泛化能力,为该语言社区提供了首个针对统计学推理的标准化评估工具,对推动土耳其语NLP模型在学术推理场景中的应用具有重要价值。
当前挑战
该数据集面临的挑战主要体现在三个方面。首先,领域问题层面,统计学推理要求模型不仅掌握术语定义,还需进行多步逻辑推导并避免常见认知误区,对语言模型的符号运算与抽象推理能力构成严峻考验。其次,构建过程中,为确保评估公平性,37个问题从原始400题中分层抽取,但需额外生成63个新问题以增强统计可靠性,同时严格验证所有100题与训练集无重叠,耗费大量人力与专业知识。此外,多语言语义相似度评分方法虽能衡量概念接近程度,却无法保证事实准确性,需人工复核以规避评估偏差,这些因素共同提升了基准的维护成本与泛化难度。
常用场景
经典使用场景
Türkçe İstatistik Benchmark 数据集专为评估土耳其语大语言模型在统计推理任务上的泛化能力而设计。该基准包含100道精心构造的问答对,覆盖统计学七大核心模块——从基础概念到回归分析,且确保与训练数据无任何重叠。其典型使用场景是作为零样本或少样本评估的标杆,研究者通过计算模型输出与人工参考答案之间的语义相似度,客观衡量模型在统计知识理解、数学推理及概念应用上的真实水平。该数据集以中等难度题目为主体,并包含大量概念性、解释性及陷阱类问题,能够有效检测模型对统计原理的深度掌握程度,而非简单的模式记忆。
衍生相关工作
该数据集的发布催生了多项衍生的经典研究。一方面,研究者基于其分层结构开发了细粒度的能力诊断工具,通过分析模型在七个统计模块上的表现差异,识别其薄弱环节并指导后续微调策略。另一方面,该基准中的陷阱类问题被用于构建对抗性测试集,专门用于检测模型在统计常见误区上的鲁棒性。此外,有工作借鉴其无重叠的数据拆分方法,推广至其他低资源语言的科学教育领域,如医学、物理推理等,形成了跨学科评估基准的构建范式。这些衍生工作进一步强化了该数据集作为土耳其语统计推理研究基石的地位。
数据集最近研究
最新研究方向
该基准测试聚焦于土耳其语统计推理能力的评估,填补了低资源语言在量化推理与因果推断领域缺乏标准化评测工具的空白。研究前沿集中于构建分层统计模块(覆盖推断基础、描述统计、概率分布、假设检验等7大主题),并采用难度与题型双重标签体系(概念、解释、陷阱类问题),以细粒度评估语言模型在统计推理中的语义理解与逻辑严谨性。当前热点关联多语言模型在学术教育场景的公平性验证,尤其关注chain-of-thought推理是否引入虚假相关性;该基准通过嵌入余弦相似度与人类参考答案的对齐,为评估模型在统计直觉与事实准确性之间的权衡提供方法论参照,对改进土耳其语等低资源语言的数学推理评测具有标杆意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务