遇见数据集

Semantic-Flow-Dynamics-SFD

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

Semantic Flow Dynamics (SFD) 是一个形式化社会科学理论语料库,由黃正宇(Cheng Yu Huang)创建并维护,采用 MIT 许可证。该数据集是一个持续进行的项目,旨在将所有主要社会科学理论重写为统一的、形式化指定的框架,即 Semantic Flow Dynamics (SFD)。目前覆盖十个领域:宗教与现代化、文明起源、文明崩溃、比较文明、经济学、家庭动态、AI 安全、权力与制度、自我定位、信息论。每个领域都被视为同一形式化基础(两个原始概念、三个核心定义、四个公理)的派生应用,而非独立理论。数据集包含完整的三层结构:论文层(人类可读的源论文)、形式化层(逻辑一致的推导和概念定义)、Java 层(保证引用完整性和无断裂概念链接)。形式化文件遵循固定模式,包含上游概念、概念定义、公设(含显式挑战条件)、前置条件、逐步推导(引用公理)、中英双语概念列表以及待决项。所有推导都具有可验证的地面真相(conclusion ← premises)。数据集可用于评估大语言模型的形式化推理能力(推导链具有显式地面真相,模型输出可验证)、构建知识图谱(概念依赖关系是可机器读取的且由 UUID 索引)、在结构化理论上进行 RAG(概念具有显式边界、公理来源和推导链)、跨领域理论推理基准测试(一个框架涵盖社会学、经济学、政治学、心灵哲学、AI 安全和文明动力学),以及作为中文学术推理语料库(中文形式化推理文本,配有英文概念注释)。数据集还包含一个交互式概念星图(starmap.html),可浏览整个语料库的概念依赖关系。

Semantic Flow Dynamics (SFD) is a formalized social science theory corpus, created and maintained by Cheng Yu Huang, licensed under MIT. This dataset is an ongoing project aiming to rewrite all major social science theories into a unified, formally specified framework called Semantic Flow Dynamics (SFD). It currently covers ten domains: Religion and Modernization, Origins of Civilization, Collapse of Civilization, Comparative Civilization, Economics, Family Dynamics, AI Safety, Power and Institutions, Self-Positioning, and Information Theory. Each domain is treated as a derivative application of the same formal foundation (two primitive concepts, three core definitions, four axioms), rather than an independent theory. The dataset includes a complete three-layer structure: paper layer (human-readable source papers), formalization layer (logically consistent derivations and concept definitions), and Java layer (ensuring citation integrity and no broken concept links). Formalization files follow a fixed pattern, including upstream concepts, concept definitions, postulates (with explicit challenge conditions), preconditions, step-by-step derivations (citing axioms), bilingual concept lists (Chinese and English), and pending items. All derivations have verifiable ground truth (conclusion ← premises). The dataset can be used for evaluating formal reasoning abilities of large language models (derivation chains with explicit ground truth, model outputs verifiable), building knowledge graphs (concept dependencies are machine-readable and indexed by UUID), performing RAG on structured theories (concepts with explicit boundaries, axiom sources, and derivation chains), cross-domain theory reasoning benchmarks (a single framework covering sociology, economics, political science, philosophy of mind, AI safety, and civilizational dynamics), and as a Chinese academic reasoning corpus (Chinese formal reasoning text with English concept annotations). The dataset also includes an interactive concept star map (starmap.html) to browse concept dependencies across the entire corpus.

创建时间:
2026-08-11
原始信息汇总

Semantic Flow Dynamics (SFD) 数据集概述

基本信息

  • 数据集名称:Semantic Flow Dynamics (SFD)
  • 作者:黃正宇 (Cheng Yu Huang)
  • 联系方式:mthree.tw@gmail.com
  • 许可证:MIT License
  • 语言:中文(主要)、英文(概念注释)
  • 标签:推理、形式化方法、知识图谱、基准测试、大语言模型评估、形式化理论、社会科学、语义学、信息论、哲学、学术、文本

数据集定位

该数据集是一个持续进行中的项目,目标是在统一的正式规范框架——语义流动力学(SFD)下,重写所有主要的社会科学理论。它并非论文集合,而是一个封闭的形式系统:每个概念都有定义,每个定义都有推导来源,每个推导都可追溯至公理。

覆盖领域

领域 状态
宗教与现代化 已完成
文明起源 已完成
文明崩溃 已完成
比较文明 已完成
经济学 已完成
家庭动力学 已完成
AI安全 已完成
权力与制度 已完成
自我定位 已完成
信息论 已完成

数据集功能与应用

  1. 评估LLM形式化推理能力——推导链具有明确的真实答案,模型输出可被验证
  2. 知识图谱构建——概念依赖关系机器可读,并以UUID索引
  3. 结构化理论上的RAG——概念具有明确的边界、公理来源和推导链
  4. 跨领域理论推理基准测试——单一框架覆盖社会学、经济学、政治学、心灵哲学、AI安全和文明动力学
  5. 中文学术推理语料库——中文形式推理文本附英文概念注释

框架基础

层级 内容
原始概念(2个) 個體 (Individual)、刺激 (Stimulus)
核心定义(3个) 信 (Xin)、語意流 (Semantic Flow)、信號 (Signal)
公理(4个) 流變律 (Law of Flux, P1)、黑箱律 (Law of Black-box, P2)、損耗律 (Law of Dissipation, P3)、死亡律 (Law of Death, P4)
推导(7个以上) 过滤、转化、坍塌、正反馈循环、循环不稳定性、世代更替、循环替代模型

核心公理——黑箱律(P2)指出,语义流的下一时刻无法由其当前方向和输入信号决定,这使SFD与哥德尔不完备定理、海森堡不确定性原理和图灵停机问题处于相同的结构边界。每个公理都包含显式的挑战条件——即其证伪所需的确切逻辑否定。

三层架构

每个论文均以三个协调层次存在:

  1. 论文层——人类可读,是真实性的来源
  2. 形式化层——逻辑一致性,显式推导
  3. Java层——引用完整性,无断裂的概念链接

三个层次的一致性由群星規範 (Qunxing Specification) 管理,这是一个元文档,定义整个系统的增长方式及其一致性边界。

形式化文件结构

每个 formalization.md 遵循固定模式(由群星規範强制),包括:

  • 上游概念(按UUID导入)
  • 本篇概念定义(原始→核心→补充)
  • 公设(带显式挑战条件)
  • 前置条件
  • 推导(带公理引用的逐步推导)
  • 概念摘要(中英双语完整概念列表)
  • 待决项(开放问题)

推导示例(四、正反饋循環):

信號到達個體 ⇒ 過濾放行(D3)⇒ 轉化(P2)⇒ 坍塌為行為(P3有損)⇒ 行為結果成為新信號 ⇒ 新信號強化語意流既有方向 ⇒ 下一次同類信號更易通過過濾 [回到起始] 結論:正反饋循環 ← P1 + D3 + 坍塌 ✓

每个推导都可验证:结论 ← 前提,具有真实答案。

引用信息

黃正宇 (Cheng Yu Huang). Semantic Flow Dynamics (SFD) Corpus. Hugging Face Datasets, 2026. https://huggingface.co/datasets/mthreetw/Semantic-Flow-Dynamics-SFD Contact: mthree.tw@gmail.com

搜集汇总
数据集介绍
Semantic-Flow-Dynamics-SFD 数据集图片
构建方式
Semantic Flow Dynamics (SFD) 数据集是一项宏大的学术工程,旨在以统一的形式化框架重写社会科学各领域的理论体系。该数据集覆盖宗教与现代性、文明起源与崩溃、比较文明、经济学、家庭动态、AI安全、权力与制度、自我定位及信息论等十大领域。每个领域并非独立理论,而是同一形式基础——两个原始概念(个体、刺激)、三个核心定义(信、语义流、信号)及四条公设(流变律、黑箱律、损耗律、死亡律)——的衍生应用。数据构建采用三层架构:论文层为人类可读的源文本,形式化层提炼逻辑一致的定义与推导,Java层则通过代码确保概念引用的完整性与无断裂。所有内容遵循群星规范,实现跨层一致性验证。
特点
该数据集的核心特点在于其封闭形式系统与科学严谨性。每个概念都有明确定义,每个定义有推导来源,每条推导可追溯至公设,形成可验证的推理链。黑箱律(P2)揭示了语义流动不可完全预测的结构边界,与哥德尔不完备定理、海森堡不确定性原理及停机问题相呼应。每条公设附有明确的可证伪条件,支持严格的逻辑检验。数据集的跨学科特性使其能同时作为社会科学理论基准、知识图谱构建源、结构化RAG测试集及LLM形式推理评估工具,并提供中英文双语学术推理语料。交互式概念星图(starmap.html)和UUID索引,为探索跨域概念依赖提供了直观工具。
使用方法
用户可通过Hugging Face页面直接访问数据集资源。针对LLM形式推理评估,可利用推导链的显式ground truth验证模型输出。知识图谱构建可借助概念间机器可读的UUID关联及定义来源。RAG应用可依托概念边界明确的节点结构,结合星图交互检索。基准测试可选用任一领域或综合跨域任务,检验模型在多学科理论推理上的能力。代码库中的Java层与校验器(formalization-validator.html)辅助验证数据完整性,便于定制化分析。开源许可(MIT)允许修改与再分发,鼓励学术社区在此基础上扩展新领域或深化既有理论。
背景与挑战
背景概述
Semantic-Flow-Dynamics-SFD(SFD)数据集由黃正宇(Cheng Yu Huang)于2026年创建,旨在以统一的形式化框架重写社会科学领域的核心理论。该数据集覆盖宗教、经济、文明兴衰、AI安全等多个领域,基于两个原始概念、三个核心定义和四条公理,构建了一个封闭的形式化系统,用于评估大语言模型的正式推理能力、构建知识图谱以及支持跨领域理论推理的基准测试。其设计将理论论文化与Java形式化层相结合,通过群星规范确保系统一致性,为社会科学计算化和LLM形式推理验证提供了独特资源,对推动社会科学与人工智能交叉研究具有影响力。
当前挑战
该数据集所面临的挑战包括:其一,在领域问题层面,社会科学理论常因语义模糊和逻辑松散而难以形式化,SFD需在保持理论丰富性的同时,确保形式化推导的严密性,这对LLM的形式推理能力提出高要求,并需在跨领域统一框架下维持概念边界和逻辑一致性。其二,在构建过程中,需将多领域理论提炼为统一公理体系,协调不同理论的特定假设与通用框架之间的张力,同时保证所有推导链的显式可验证性,并维护三层架构(论文层、形式化层、Java层)的同步与完整性,这涉及大量人工梳理与验证工作,且需应对理论更新带来的连锁影响。
常用场景
经典使用场景
该数据集的核心应用在于评估大型语言模型(LLM)的正式推理能力,其推导链具有明确的真实基准,模型输出可被严格验证。同时,它支持构建知识图谱,其概念依赖关系以机器可读形式存储,便于构建结构化知识表示。此外,它可作为跨领域理论推理的基准测试集,覆盖社会学、经济学、政治科学、心灵哲学、AI安全及文明动力学等多个领域,为评估模型的跨域泛化能力提供了独特平台。
衍生相关工作
该数据集衍生了一系列相关工作,如形式化验证工具的开发,包括Java层的一致性检查和参考完整性验证,形成了结构测试与星图生成器。在此基础上,催生了‘群星规范’等元文档,用于指导系统扩展与一致性维护。未来可能催生基于SFD公理的自动理论发现系统、跨语言推理评估基准,以及将黑箱律与不完备性定理类比的研究,拓展了形式化方法在社会科学和AI安全中的应用。
数据集最近研究
最新研究方向
Semantic Flow Dynamics (SFD) 语料库正引领一项前沿研究:将社会科学理论形式化为一个封闭公理系统,以两条原始概念、三条核心定义与四条公理为根基,覆盖宗教、文明、经济、AI安全等跨领域议题。该方向聚焦于利用此形式化框架评估大型语言模型的推理能力,通过显式的推导链与公理溯源为模型输出提供可验证的基准,同时构建机器可读的知识图谱与结构化理论检索增强生成(RAG)系统。其核心黑箱律(P2)与哥德尔不完备定理、海森堡不确定性原理及图灵停机问题的结构性同构,为探讨语义流动态的不可判定性开辟了新维度,推动形式化社会科学与计算语言学交叉领域的发展,并助力中文形式化推理语料库的建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务