Enigmata-Data
收藏资源简介:
Enigmata-Data包含36个不同的任务类型,涵盖7类逻辑推理谜题。每个任务都配有生成器和验证器,生成器可以产生无限数量的谜题实例,并精确控制难度参数,验证器提供自动的、基于规则的解决方案验证。
Enigmata-Data encompasses 36 distinct task types, covering 7 categories of logical reasoning puzzles. Each task is accompanied by a generator and a validator; the generator is capable of producing an infinite number of puzzle instances while precisely controlling difficulty parameters, and the validator provides automatic, rule-based solution verification.
Enigmata数据集概述
数据集简介
- 名称:Enigmata
- 类型:逻辑推理谜题数据集
- 目标:提升大语言模型的逻辑推理能力
- 特点:
- 首个专注于谜题推理能力的综合套件
- 支持基于规则的可验证奖励的强化学习
数据集组成
Enigmata-Data
- 任务数量:36个
- 任务类别:7类
- 核心组件:
- 生成器:可生成无限量实例,支持难度控制
- 验证器:提供基于规则的自动验证
- 优势:
- 无限自验证数据
- 可控难度
- 灵活的任务采样
Enigmata-Eval
- 基准测试规模:4,758个谜题实例
- 难度级别:Easy、Medium、Hard
- 数据划分:严格的训练-评估分离
模型训练与应用
训练方法
- 两阶段训练:
- 拒绝微调(RFT)
- 多任务强化学习(带可验证奖励)
- 代表性模型:Qwen2.5-32B-Enigmata
性能表现
- 优势领域:密码学、算术、逻辑任务
- 挑战领域:空间和顺序任务
- 泛化能力:在AIME、GPQA Diamond等高级推理任务中表现优异
数据与模型资源
- Enigmata-Eval下载:HuggingFace Dataset
- 模型资源:Qwen2.5-32B-Enigmata
引用
bibtex @article{2025enigmata, title={Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles}, author={Jiangjie Chen, Qianyu He, Siyu Yuan, Aili Chen, Zhicheng Cai, Weinan Dai, Hongli Yu, Qiying Yu, Xuefeng Li, Jiaze Chen, Hao Zhou, Mingxuan Wang}, journal={arXiv preprint arXiv:2505.19914}, year={2025} }




