遇见数据集

Lightcap/nocisnn-turkish-logic-traces

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

NociSNN土耳其数学逻辑轨迹数据集记录了由土耳其语LLM模型在持续运行的NociSNN评估循环中生成的结构化数学推理轨迹。数据生成基于确定性土耳其语模板,涵盖算术、百分比、比例和单变量线性方程问题,真实答案由任务生成器计算。模型为每个问题生成简短的JSON解决步骤,验证器检查格式、与先前步骤的链接、重复、漂移、矛盾及最终答案正确性。数据集保存了接受和拒绝的尝试,以便研究惩罚行为。每条JSONL记录包含合成土耳其语问题、代码导出的预期答案、模型标识符、策略摘要、结构化步骤(或原始输出字符串)、验证标志(如接受、重复、漂移、矛盾、最终正确)以及NociSNN观察值和状态摘要。该数据集是自动生成的研究观察数据,非人工编写的数学解释或监督黄金推理,使用者应利用包含的正确性和拒绝元数据,避免将所有行视为正面训练目标。

The NociSNN Turkish Mathematical Logic Trace Dataset documents structured mathematical reasoning traces generated by Turkish LLMs during the continuously running NociSNN evaluation loop. Data generation is based on deterministic Turkish templates, covering arithmetic, percentage, ratio, and univariate linear equation problems, with ground-truth answers calculated by the task generator. For each problem, the model generates concise JSON-formatted solution steps, while a validator checks formatting compliance, links to prior steps, repetitions, drift, contradictions, and the correctness of the final answer. The dataset stores both accepted and rejected attempts to support research on penalty behaviors. Each JSONL entry contains a synthesized Turkish question, code-derived expected answer, model identifier, policy summary, structured steps (or raw output string), validation flags (e.g., "accepted", "repeated", "drifted", "contradictory", "finally correct"), as well as NociSNN observations and state summaries. This dataset consists of automatically generated research observation data, rather than manually written mathematical explanations or supervised gold-standard reasoning. Users should leverage the included correctness and rejection metadata, and avoid treating all entries as positive training targets.

提供机构:
Lightcap
搜集汇总
数据集介绍
Lightcap/nocisnn-turkish-logic-traces 数据集图片
构建方式
本数据集由NociSNN持续评估循环驱动生成,依托`ogulcanaydogan/Turkish-LLM-7B-Instruct-GGUF:Q4_K_M`模型产出结构化的土耳其语数学推理轨迹。问题源自确定性模板,涵盖算术、百分比、比例及一元一次方程等基础数学领域,真实答案由任务生成器直接计算得出,而非依赖语言模型。模型针对每个问题生成简短JSON格式的求解步骤,验证器对格式合规性、前后步骤的衔接性、内容重复性、语义漂移、逻辑矛盾及最终答案正确性进行严格核验。无论步骤是否被接受,所有尝试均被记录,以便在后续研究中深入分析惩罚机制对推理行为的影响。
特点
该数据集以稳定的标量列形式存储每条JSONL记录,兼容Hugging Face数据集查看器,便于研究者直接浏览与筛选。每条记录包含土耳其语合成问题及代码导出的预期答案、模型标识符与策略摘要、序列化步骤JSON字段(若格式验证失败则保留原始输出字符串),以及丰富的验证标签如是否被接受、是否重复、是否存在漂移或矛盾、最终答案正确性等。此外,数据还记录了NociSNN观测值及动作前后的状态摘要(p、D、L、z),使研究者能够从状态空间角度剖析推理过程。
使用方法
本数据集定位为自动化生成的研究观测数据,并非人工撰写的数学解释或监督式黄金推理标准。使用者应充分利用内嵌的正确性及拒绝元信息,避免将所有记录不加区分地视为正向训练目标。适用于分析土耳其语数学推理中的步骤生成、错误模式及模型在持续评估框架下的行为变化,尤其适合研究惩罚机制对推理轨迹质量的影响。数据集不包含任何凭据、环境变量或服务密钥,确保研究的开放性与安全性。
背景与挑战
背景概述
在数学推理与自然语言处理交叉领域,结构化推理轨迹的获取与评估长期面临数据稀疏与标注成本高昂的困境。为此,由NociSNN团队主导,于近期创建了面向土耳其语数学逻辑推理的数据集,该数据集由ogulcanaydogan/Turkish-LLM-7B-Instruct-GGUF模型在持续运行的NociSNN评估循环中自动生成。核心研究问题聚焦于如何通过确定性模板生成涵盖算术、百分比、比例及一元线性方程的问题,并利用任务生成器直接计算真实答案,从而规避语言模型自身的不确定性。该数据集通过保留模型每一步的接受与拒绝尝试,为研究惩罚行为与推理路径的演化机制提供了独特视角,对土耳其语推理模型的鲁棒性评估与自我修正能力研究具有重要推动价值。
当前挑战
该数据集所解决的领域挑战在于:传统土耳其语数学推理数据多依赖人工标注,规模有限且难以捕捉模型推理过程中的中间状态变化,而此数据集通过结构化步骤验证机制(包括格式检查、步骤连贯性、重复性、漂移、矛盾及最终答案正确性)系统性记录了推理轨迹,为理解模型决策突破提供数据基础。构建过程中面临的挑战则包括:确保合成问题的领域覆盖度与难度层次均衡,设计严格的验证器以避免错误传播,以及处理JSON格式验证失败时的原始输出存储问题。此外,由于数据完全由模型生成,需警惕自动标注中的系统性偏差,通过保留拒绝记录并明确标注接受状态,以支持对推理失败模式的深入研究。
常用场景
经典使用场景
该数据集的核心价值在于为土耳其语数学推理任务提供结构化的中间推导轨迹,尤其适用于评估与微调大型语言模型在算术、百分比、比例及一元线性方程等基础数学问题上的逐步推理能力。研究者可利用其中的JSON格式解题步骤、验证标志(如接受、重复、漂移、矛盾)以及NociSNN状态变量,深入分析模型在连续推理过程中的稳定性与逻辑一致性。
解决学术问题
该数据集精准回应了当前大语言模型在推理任务中普遍存在的“逻辑断裂”与“步骤漂移”问题,为学术界提供了一个可量化的基准以衡量模型的推理连贯性。通过记录每次推理尝试的接受与否,以及是否出现重复、矛盾或最终答案错误,研究者得以系统性地诊断模型在复杂推理链中的薄弱环节,进而推动更稳健的推理算法与反馈机制的设计。
衍生相关工作
该数据集启发了多个方向的衍生研究:一方面,基于其步骤验证机制,研究者发展出针对低资源语言推理的强化学习奖励塑造方法,利用接受的步骤作为正向信号;另一方面,其记录的漂移与矛盾标志被用于训练检测模型生成幻觉的判别器。此外,NociSNN状态变量为脉冲神经网络与大语言模型的协同推理提供了可复现的观测数据,催生了时空逻辑一致性评估的新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务