LogicMark
收藏资源简介:
LogicMark 是一个用于评估语言模型符号逻辑能力的程序化生成基准数据集。每个问题提供一组变量相等/不等的前提,要求模型识别必然成立的结论。与基于知识的基准不同,LogicMark 不包含模型可能从预训练中记忆的任何事实,所有问题均使用抽象变量名(如 `a`, `b`, `c` 等)生成,确保模型必须进行实际推理而非模式匹配。数据集包含 1000 个问题,按跳数深度(1 至 5 跳)分布,其中 1 跳占 10%,2 跳占 40%,3 跳占 25%,4 跳占 15%,5 跳占 10%。问题生成采用六种等式图拓扑结构(链式、星型、簇、树、二分和混合),以确保多样化的推理模式。数据集格式为 JSON,包含问题 ID、领域、上下文、选项、答案索引、答案和跳数深度等信息。该数据集适用于评估语言模型的固有推理能力,特别是在符号逻辑任务上的表现。
LogicMark is a programmatically generated benchmark dataset designed to evaluate the symbolic logical reasoning capabilities of language models. Each problem provides a set of premises about the equality or inequality of variables, and requires the model to identify the necessarily valid conclusions. Unlike knowledge-based benchmarks, LogicMark contains no facts that models might memorize during pre-training. All problems are generated using abstract variable names (such as `a`, `b`, `c`, etc.), ensuring that models must perform actual reasoning rather than pattern matching. The dataset contains 1000 questions, distributed by reasoning hop depth (1 to 5 hops): 10% for 1-hop, 40% for 2-hop, 25% for 3-hop, 15% for 4-hop, and 10% for 5-hop. The problem generation adopts six types of equation graph topologies (chain, star, cluster, tree, bipartite, and hybrid) to ensure diverse reasoning patterns. The dataset is formatted in JSON, and includes information such as question ID, domain, context, options, answer index, answer, and hop depth. This dataset is suitable for evaluating the inherent reasoning capabilities of language models, particularly their performance on symbolic logical reasoning tasks.
LogicMark 数据集概述
数据集基本信息
- 名称: LogicMark
- 发布者: Axiomic Labs
- 许可证: Apache 2.0
- 语言: 英语
- 数据规模: 1K<n<10K
- 示例数量: 1000个问题(当前数据集)
数据集目的与特点
LogicMark是一个用于评估语言模型符号逻辑推理能力的程序化生成基准测试。每个问题呈现一组变量相等/不相等的前提,并要求模型识别哪个结论必然成立。该基准测试不包含任何模型可能从预训练中记忆的事实知识,所有问题均使用抽象变量名(a, b, c, ...)生成,因此模型无法通过模式匹配训练数据来回答,必须进行实际推理。这使得LogicMark成为对内在推理能力的直接探测:即通过训练构建到模型权重中的逻辑结构,独立于世界知识或表面启发式方法。
评估方法
评估采用对数似然多项选择法,无需思维链或提示技巧。模型完全根据其为正确完成分配概率的好坏程度进行评分。随机猜测的正确率为25%。
任务格式
每个问题包含一组前提和一个多项选择问题。模型必须选择由前提逻辑蕴含的选项。干扰项包括正确答案的翻转版本以及从同一变量集中提取的错误陈述。
跳数深度
每个问题都标有跳数深度——从前提推导出正确答案所需的最小推理步骤数:
- 1跳: 答案直接作为前提陈述。
- 2跳: 需要一个传递步骤。
- 3跳: 需要两个传递步骤。
- 4跳以上: 更长的推理链。
当前数据集(1000个问题)的目标分布如下:
| 跳数 | 目标比例 |
|---|---|
| 1 | 10% |
| 2 | 40% |
| 3 | 25% |
| 4 | 15% |
| 5 | 10% |
图样式
前提使用六种相等性图拓扑生成,每种产生不同的推理模式:
chain: 变量以线性序列链接。star: 一个中心变量连接到许多其他变量。clusters: 内部链接的变量组。tree: 二叉树拓扑——最大化每个变量的链深度。bipartite: 边仅在两个半区之间交叉——同侧相等在结构上不可能。mixed: 上述样式的随机组合。
数据集格式
数据集以JSON格式提供,每个条目包含以下字段:
id: 问题唯一标识符。domain: 领域(固定为"Symbolic")。context: 问题上下文,包含前提。options: 多项选择选项列表。answer_index: 正确答案在选项列表中的索引。answer: 正确答案文本。hop_depth: 问题的跳数深度。
生成器
数据集由baseloggen_v2.py生成器创建,该生成器具有跳数深度控制和相等类型平衡功能。关键配置参数包括:
min_answer_hop: 正确答案的最小跳数深度(抑制简单问题)。target_hop_dist: 映射跳数深度到比例的字典。生成器精确采样每个桶。styles: 要从中采样的图拓扑元组。
设计决策
- 相等类型平衡: 正确答案以50/50的比例从
=和!=陈述中采样,以防止模型利用“正确答案往往是相等陈述”这一观察结果。 - 精确跳数目标: 当设置
target_hop_dist时,每个桶通过拒绝采样生成,精确针对该跳数深度,而不是依赖自然分布(后者严重偏向2跳)。 - 翻转干扰项: 正确答案的否定形式始终作为干扰项包含在内,以确保模型不能通过忽略不等式结构来获胜。
基准测试结果
基准测试结果基于5000个示例(每个跳数桶500个)进行评估,使用结束令牌的平均对数似然并按长度归一化。结果表格比较了不同公司和模型在1跳至5跳以及平均性能上的表现。




