nocisnn-turkish-logic-traces
收藏资源简介:
NociSNN Turkish Mathematical Logic Traces 是一个包含结构化土耳其语数学推理轨迹的数据集,这些轨迹由特定指令调优的土耳其语语言模型在持续运行的 NociSNN 评估循环中生成。数据集旨在记录模型在解决数学问题时的推理过程。数据生成基于确定性的土耳其语模板,涵盖算术、百分比、比例和单变量线性方程问题。每个问题的真实答案由任务生成器计算,而非语言模型。对于每个问题,模型生成简短的 JSON 格式解决方案步骤,随后由验证器检查格式、与先前接受步骤的链接、重复、漂移、矛盾以及最终答案的正确性。数据集同时保留了被接受和被拒绝的尝试,以便研究惩罚行为。每条 JSONL 记录包含多个稳定标量列,以确保与 Hugging Face 数据集查看器的兼容性。记录内容主要包括:合成的土耳其语问题及代码导出的预期答案;模型标识符和选定的简短策略摘要;序列化在 `step_json` 中的结构化步骤,或在模式验证失败时的 `raw_output` 字符串(未使用的文本字段为空字符串);验证标志,如 `accepted`、`repeat`、`drift`、`contradiction` 和 `final_correct`;以及 NociSNN 观察值及动作前后的 `p`、`D`、`L`、`z` 状态摘要。该数据集适用于文本生成任务,特别是土耳其语的数学推理研究。预期用途是作为自动生成的研究观察数据,用于分析模型的推理行为和验证机制。需要注意的是,这些轨迹是自动生成的研究观察,并非人类编写的数学解释或监督下的黄金推理。使用者应利用包含的正确性和拒绝元数据,避免将所有行视为正面的训练目标。数据集不包含任何凭证、环境变量或服务密钥。
数据集概述
数据集名称: NociSNN Turkish Mathematical Logic Traces
许可证: Apache-2.0
语言: 土耳其语 (tr)
任务类别: 文本生成 (text-generation)
标签: 土耳其语、推理、数学、合成数据、大语言模型生成、NociSNN
完整名称: NociSNN土耳其数学逻辑推理轨迹
数据生成方式
- 问题来源于确定性的土耳其语模板,涵盖算术、百分比、比例和单变量线性方程。
- 真实答案由任务生成器计算得出,而非语言模型。
- 模型对每个问题生成短JSON格式的解题步骤。
- 验证器检查格式、与上一步的关联性、重复、偏移、矛盾以及最终答案的正确性。
- 接受和拒绝的尝试均被保留,以便研究惩罚行为。
记录内容
每条JSONL记录包含以下字段:
- 合成的土耳其语问题及代码推导的预期答案
- 模型标识符和选定的简短策略总结
- 结构化步骤(
step_json),或当模式验证失败时的原始输出(raw_output);未使用的文本字段为空字符串 - 验证标志:
accepted(接受)、repeat(重复)、drift(偏移)、contradiction(矛盾)、final_correct(最终正确) - NociSNN观测值及动作前后的
p、D、L、z状态摘要
预期用途与限制
- 轨迹为自动生成的研究观测数据,非人工编写的数学解释或监督式黄金推理。
- 使用者应利用包含的正确性与拒绝元数据,避免将所有行视为正向训练目标。
- 发布记录中不包含任何凭证、环境变量或服务密钥。




