遇见数据集

Venkatdatta/fol-data

收藏
Hugging Face2026-04-25 更新2026-05-03 收录
官方服务:

资源简介:

FOL推理数据集是一个经过预处理和词汇增强的数据集,源自ProofWriter OWA分割,专为训练自然语言到一阶逻辑的翻译模型而构建。源数据集包含英语的自然语言前提和问题以及结构化证明元数据。本数据集的预处理添加了原始数据集未提供的两个内容:1) FOL翻译:每个自然语言语句通过基于规则的翻译器转换为一级逻辑(覆盖率达100%),例如“Anne is kind”转换为`Kind(anne)`,“If someone is kind then they are furry”转换为`forall x (Kind(x) -> Furry(x))`,证明链和未知失败轨迹也转换为FOL形式;2) 词汇替换:实体和谓词名称在每个问题中被随机替换为来自大型NLTK/WordNet池的词汇,强制模型学习结构化的FOL映射而不是表面名称记忆。词汇替换使用7,372个实体名称(来自NLTK names语料库)、13,006个属性词(来自WordNet形容词同义词集词元)和7,463个关系词(来自WordNet动词同义词集词元),所有原始ProofWriter词汇被排除在替换池之外。数据集结构为JSONL格式,每个示例包含premises、logic、qdep、answer和source字段。数据分割包括train(229,832个示例)、dev(33,042个示例)和test(66,084个示例),类别分布包括pos_True、neg_False、pos_Unknown、neg_Unknown、pos_False和neg_True。数据集基于CC BY-NC-SA 4.0许可证发布,仅限非商业使用。

--- 许可协议:cc-by-nc-sa-4.0 语言: - 英语 任务类别: - 翻译 - 问答 - 文本生成 标签: - 逻辑推理 - 一阶逻辑(First-Order Logic, FOL) - ProofWriter - 符号推理 - 自然语言推理 展示名称:FOL推理数据集(词汇增强版ProofWriter) 样本规模类别: - 100K<n<1M --- ## 一阶逻辑推理数据集 本数据集为经预处理与词汇增强的衍生数据集,源自[ProofWriter(Kaggle平台)](https://www.kaggle.com/datasets/mathurinache/proofwriter)的开放世界假设(Open World Assumption, OWA)划分集,旨在用于训练自然语言→一阶逻辑的翻译模型。 原始数据集包含英语自然语言形式的前提与问题,以及结构化的证明元数据。我们的预处理步骤新增了原始数据集未提供的两项内容: 1. **一阶逻辑译文**:通过基于规则的翻译器将每条自然语言语句转换为一阶逻辑形式(覆盖度达100%)。ProofWriter的自然语言语句与一阶逻辑存在确定性映射关系(例如“安妮友善”→`Kind(anne)`,“若某人友善则其有毛发”→`forall x (Kind(x) -> Furry(x))`)。证明链与未知结果的失败回溯也会被转换为一阶逻辑形式。 2. **词汇替换**:针对每个问题,从大型自然语言工具包(Natural Language Toolkit, NLTK)/WordNet词库中随机抽取词汇替换实体与谓词名称,迫使模型学习结构化的一阶逻辑映射而非表面词汇的记忆。 ## 词汇替换策略 原始ProofWriter使用规模极小的固定词表(包含20个实体名称,如Anne、Bob、bear、dog;20个属性词,如kind、furry、blue;6个关系词,如visits、chases)。本数据集针对每个问题,将所有实体与谓词名称替换为从以下词库中随机抽取的词汇: - **7,372个实体名称** —— NLTK的`names`语料库(仅保留3-9个字符的纯字母名字) - **13,006个属性词** —— WordNet形容词同义词集词元(仅保留4-10个字符的纯字母词汇) - **7,463个关系词** —— WordNet动词同义词集词元(仅保留4-10个字符的纯字母词汇) 替换词库中不包含原始ProofWriter的所有词汇。且每个问题内的替换保持一致性(同一实体始终映射到同一个替换词汇)。 ## 数据集结构 每个划分集均为JSONL格式文件,每行对应一个样本: json { "premises": "Venkat is perseverant. If someone is perseverant they discover. <extra_id_0> Venkat discovers.", "logic": "<extra_id_1> Perseverant(venkat) forall x (Perseverant(x) -> Discover(x)) <extra_id_2> Discover(venkat) <extra_id_3> Perseverant(venkat) and forall x (Perseverant(x) -> Discover(x)) -> therefore Discover(venkat) <extra_id_4> True", "qdep": 1, "answer": "True", "source": "depth-2/meta-train-1234" } ### 字段说明 | 字段名 | 数据类型 | 字段说明 | |-------|------|-------------| | `premises` | 字符串 | 编码器输入:自然语言事实与规则,后跟`<extra_id_0>`,再后跟自然语言问题——所有词汇均已完成替换 | | `logic` | 字符串 | 完整的解码器目标输出:一阶逻辑前提→一阶逻辑问题→证明链→答案 | | `qdep` | 整数 | 问题推理深度(0-7):得到正确答案所需的最少推理步数 | | `answer` | 字符串 | 真实标签:可为`"True"`、`"False"`或`"Unknown"` | | `source` | 字符串 | 原始ProofWriter样本的ID | ### `logic`字段的标记符结构 <extra_id_1> ← 一阶逻辑前提块起始标记 Kind(anne) forall x (Kind(x) -> Furry(x)) <extra_id_2> ← 一阶逻辑问题块起始标记 Furry(anne) <extra_id_3> ← 证明链起始标记 Kind(anne) and forall x (Kind(x) -> Furry(x)) -> therefore Furry(anne) <extra_id_4> ← 答案标记 True 对于标签为`Unknown`的样本,其证明链为失败回溯链: <extra_id_3> forall x (Big(x) and Round(x) -> White(x)) <- Rough(fiona) -> Big(fiona) <- [no base fact] 无法从给定前提中推导得出结论。 <extra_id_4> Unknown ## 数据集划分 | 划分集 | 样本数量 | 文件大小 | |-------|----------|-----------| | 训练集 | 229,832 | 约302 MB | | 验证集 | 33,042 | 约45 MB | | 测试集 | 66,084 | 约88 MB | ### 训练集类别分布 | 类别 | 样本数 | 占比 | |-------|-------|---| | pos_True(非否定式→True) | 58,034 | 25.3% | | neg_False(否定式→False) | 57,984 | 25.2% | | pos_Unknown | 51,808 | 22.5% | | neg_Unknown | 51,808 | 22.5% | | pos_False(非否定式→False) | 5,124 | 2.2% | | neg_True(否定式→True) | 5,074 | 2.2% | `pos_False`与`neg_True`两类样本占比极低(样本量仅为其他类别的约1/11)——训练过程中会使用加权采样器以平衡类别分布。 ## 数据集来源 本数据集基于ProofWriter的OWA深度2、深度3与深度3ext划分集构建,数据源自[Kaggle平台(mathurinache/proofwriter)](https://www.kaggle.com/datasets/mathurinache/proofwriter)。 ## 引用信息 若您使用本数据集,请引用以下文献: bibtex @misc{fol-data-2026, author = {Venkat Datta Bommena}, title = {FOL Reasoning Dataset: ProofWriter with FOL Annotations and Vocabulary Augmentation}, year = {2026}, url = {https://huggingface.co/datasets/Venkatdatta/fol-data} } 同时请引用原始数据源: bibtex @misc{mathurinache-proofwriter-kaggle, author = {mathurinache}, title = {ProofWriter}, year = {2021}, url = {https://www.kaggle.com/datasets/mathurinache/proofwriter}, note = {Kaggle dataset} } ## 许可协议 本数据集为[Kaggle平台(mathurinache/proofwriter)](https://www.kaggle.com/datasets/mathurinache/proofwriter)的衍生数据集,采用[CC BY-NC-SA 4.0](https://creativecommons.org/licenses/by-nc-sa/4.0/)许可协议发布——仅可用于非商业用途,需保留原作者署名并以相同方式共享。

提供机构:
Venkatdatta
二维码
社区交流群
二维码
科研交流群
商业服务