遇见数据集

ClassicLogic

收藏
arXiv2026-07-06 更新2026-07-08 收录
官方服务:

资源简介:

ClassicLogic是由杜伊斯堡-埃森大学研究团队创建的一个知识驱动型基准测试套件,旨在评估人工智能系统的组合泛化能力。该数据集包含数独、KenKen、Kakuro和Futoshiki四类经典逻辑谜题,通过程序化生成确保每个谜题具有唯一解,并附带分层知识库,将复杂解决策略明确定义为简单原子规则的组合。数据生成过程采用两阶段混合方法,首先生成基于策略的抽象模板,再实例化为可玩谜题,难度通过策略组合深度进行数学验证的校准。该数据集主要应用于神经符号人工智能和高级推理系统研究,旨在解决模型在逻辑演绎、多步规划和系统性推理方面的薄弱环节,为诊断模型在实体组合、关系组合和程序组合等泛化能力上的失败原因提供透明测试平台。

ClassicLogic is a knowledge-driven benchmark suite created by the research team at the University of Duisburg-Essen, designed to evaluate the compositional generalization capabilities of artificial intelligence systems. This dataset includes four classic logic puzzle types: Sudoku, KenKen, Kakuro, and Futoshiki. It is generated programmatically to ensure each puzzle has a unique solution, and is equipped with a hierarchical knowledge base that explicitly defines complex solving strategies as combinations of simple atomic rules. The data generation process adopts a two-stage hybrid approach: first generating strategy-based abstract templates, then instantiating them into playable puzzles, with their difficulty calibrated via mathematical validation of the depth of strategy combinations. This dataset is primarily applied to research on neuro-symbolic artificial intelligence and advanced reasoning systems, aiming to address the weaknesses of models in logical deduction, multi-step planning and systematic reasoning, and providing a transparent testbed for diagnosing the root causes of failures in model generalization capabilities such as entity composition, relation composition and program composition.

创建时间:
2026-07-06
搜集汇总
数据集介绍
ClassicLogic 数据集图片
构建方式
ClassicLogic基准测试套件包含四款经典逻辑谜题:数独、KenKen、数墙和不等式数独。其核心构建方法是通过两层流水线式生成流程。第一阶段,采用策略驱动模板生成算法,从规范解出发,通过迭代消去线索并利用两种求解器(完整求解器和受限求解器)验证唯一性与难度,生成最小化抽象模板。第二阶段,基于模板库进行实时实例化,通过随机回溯搜索将抽象结构和约束映射为具体谜题,并应用对称变换(如旋转、反射、值置换)生成外观多样但结构等价的实例。所有谜题均保证唯一解,且难度与所需策略的组合深度直接挂钩。
特点
该数据集最显著的特征是显式分层知识库,其中每个游戏的复杂求解策略被形式化定义为更简单基础策略的组合。例如,数独中的‘显式数对’策略是‘显式单数’和‘约束传播’的组合。这种结构允许对三种不同的组合泛化能力进行精细评估:实体组合(感知层面,如识别MNIST数字)、关系组合(规则遵循层面,如应用拉丁方约束)和程序组合(策略规划层面,如按序调用多个策略)。此外,策略生成机制确保了谜题难度可数学验证和校准,为神经符号系统等高级AI推理提供了一个透明且富有挑战性的测试平台。
使用方法
使用ClassicLogic时,研究人员可首先通过统一的环境设置脚本快速配置Python开发环境。基准测试支持端到端评估:智能体需先感知以MNIST数字渲染的视觉网格(实体组合),将其解析为符号状态;接着在离散动作空间中应用基本规则(关系组合);最终面对需要按序组合已知简单策略才能解决的高难度谜题(程序组合)。实验设计可灵活定制,例如在单一游戏上训练,然后零样本测试其他游戏;或通过难度课程学习评估程序组合泛化。所有配置通过中央JSON文件管理,并支持按模板扩展新谜题。
背景与挑战
背景概述
在人工智能领域,组合泛化能力,即理解并生成已知组件新颖组合的能力,一直是制约智能系统迈向人类层级推理的核心瓶颈。尽管现有基准如SCAN和COGS已在自然语言处理领域探索了组合泛化,但它们多聚焦于语言任务,缺乏对复杂、显式组合结构的深入评估。为弥补这一空白,来自杜伊斯堡-埃森大学的Mahnoor Shahid与Hannes Rothe于2026年共同推出了ClassicLogic基准。该基准以数独、肯肯、数墙和不等式数独四款经典逻辑谜题为载体,创新性地构建了层级化知识库,将复杂求解策略显式定义为简单基础策略的组合。这一设计为精确诊断智能体在实体感知、关系遵循及过程规划等多层面上的组合推理能力提供了统一且透明的测试平台,对推动神经符号系统等高级AI推理体系的发展具有里程碑式意义。
当前挑战
ClassicLogic所应对的核心挑战在于,现有AI系统在处理需显式、多步骤逻辑演绎的问题时,常常暴露出系统性泛化的严重缺陷。具体而言,领域层面需解决三个层次的组合推理难题:实体组合要求模型从原始视觉输入(如手写数字图像)中准确映射出符号实体;关系组合要求模型将实体与算术或不等式约束等普遍规则进行整合验证;而过程组合则要求模型将基础规则链式编排为复杂策略。在基准构建过程中,面临确保每个谜题实例具有唯一解、通过策略驱动的生成算法实现难度精确标定、以及构建完备且可扩展的层级化策略知识库等多重技术挑战。这些挑战使得ClassicLogic成为一个能够犀利诊断AI系统从模式匹配到策略推理能力断层的严苛试炼场。
常用场景
经典使用场景
在人工智能研究领域,ClassicLogic数据集主要用于评估智能体在符号推理环境中的组合泛化能力。该数据集以四款经典逻辑谜题——数独、肯肯、数墙与不等号数独——为基石,通过构建分层知识库,将复杂求解策略形式化地拆解为简单基础策略的组合。这使得研究者能够精细地考察智能体从学习基础规则到执行多步组合策略的完整推理链条,尤其适用于诊断神经符号系统在实体组合、关系组合与程序组合三个层面的表现差异。
衍生相关工作
ClassicLogic数据集的出现催生了一系列旨在提升组合推理能力的经典工作。其中包括对神经符号架构的深入探索,如SATNet、逻辑神经网络与神经模块网络,这些方法在该数据集上被系统性地检验其感知与推理的整合效果。此外,基于该数据集的诊断结果,研究者开始设计新的训练范式以弥合关系与程序泛化之间的鸿沟,推动了可微分逻辑求解器与动态网络组装等方向的发展。该数据集本身也作为开源基准,激励社区不断扩展新的逻辑谜题与策略层次,成为系统性推理研究的基石性资源。
数据集最近研究
最新研究方向
ClassicLogic作为首个系统性解构组合泛化多维度内涵的基准测试集,正引领神经符号推理领域的前沿探索。该数据集通过构建数独、肯肯、数墙与不等号迷宫四类经典逻辑谜题的分层知识体系,将复杂求解策略显式定义为原子规则的组合运算,从而精准分离并评估实体组合、关系组合与程序组合三种泛化能力。当前研究焦点集中在利用其可解释的策略层级结构,诊断神经符号模型在跨域零样本迁移及策略组合泛化中的深层缺陷。实验表明,现有架构虽能学习静态规则,但在面对需将已知策略编排为新颖多步规划的高阶谜题时,成功率骤降至25%以下,暴露出模式识别与真正策略推理之间的鸿沟。这一发现有力推动学界从规则遵循转向组合式规划能力的评测,成为检验下一代通用人工智能系统推理鲁棒性与可信度的关键试金石。
相关研究论文
  • 1
    ClassicLogic: A Knowledge-Driven Benchmark of Classic Puzzle Games for Evaluating Compositional Generalization杜伊斯堡-埃森大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务