遇见数据集

LinguaGraph

收藏
github2026-06-21 更新2026-06-22 收录
官方服务:

资源简介:

一个认知图+多语言推理数据集系统,专注于跨语言(中文/英文/德文)的概念提取、知识图谱对齐和基于语言漂移分数(LDS)的认知分析,包含10k样本,涵盖574个概念和3538个关系。

A cognitive graph and multilingual reasoning dataset system that focuses on cross-lingual (Chinese, English, German) concept extraction, knowledge graph alignment, and cognitive analysis based on the Language Drift Score (LDS). It contains 10,000 samples, covering 574 concepts and 3,538 relationships.

创建时间:
2026-06-18
原始信息汇总

数据集概述:LinguaGraph

LinguaGraph 是一个面向 BWKI 2026 竞赛的跨学科研究项目,旨在通过人工智能与图论方法,量化分析语言如何塑造人类思维方式(聚焦 Sapir-Whorf 假说)。其核心是一个多语言(中文/英文/德文)认知图谱与推理数据集系统。

核心创新与目标

  • 研究问题:语言是否改变人的思维方式?使用 AI 和图论进行量化测量。
  • LDS 指标:首个在图结构层面量化跨语言认知差异的指标。同时计算 LCD / 概念 Shift。
  • CognitiveSpace:3D 知识图谱可视化,展示 574 个概念、3538 种关系、覆盖 4 个学段、3 种语言。
  • 三语比较:对中文、德语、英语三种语言系统的认知图谱进行比较分析。

数据规模与内容

  • 语料库来源与规模:68 本教科书,包括 45 本中文(人教版、同济等)、20 本英文(Stewart、MIT、Khan 等)、10 本德文(Forster、Fischer、Klett 等)。
  • 数据集样本:包含 10,000 个样本(Gold Dataset)。
  • 知识图谱:CognitiveSpace 图包含 574 个节点、3538 条边。
  • 跨语言对齐:30 个共享概念 ID 用于跨语言对齐。
  • 实验参与者:30 名参与者(每语言 10 人),回答 5 个主题 × 3 种语言共 15 道开放性问题。
  • 计算基线:包含 300 条计算基线 + 多语言 Wikipedia 语料。

数据架构与技术栈

  • AI 模型:支持 OpenAI GPT-4.1-mini / Qwen3-8B / Ollama 的插件式 Provider 系统。
  • 图论分析:使用 NetworkX,并计算 Graph Edit Distance、Jaccard 相似度。
  • 数据存储:SQLite 数据库(10 张表)。
  • 数据可视化:使用 3d-force-graph 实现 CognitiveSpace 3D 可视化。
  • 技术复用:核心组件(Provider 抽象、GGUF 量化、LoRA 适配)已抽离为独立运行时 [MML Runtime]。

数据处理流程

  1. 语料库:教科书语料(ZH/EN/DE)。
  2. LLM 提取:通过 MIMO 提示词提取概念与关系,生成原始 JSON 文件(63 个)。
  3. 知识图谱构建:合并、去重、跨语言对齐(30 个共享概念 ID),构建 CognitiveSpace 图。
  4. 认知分析
    • 计算 LDS(Language Drift Score)。
    • 进行跨语言比较。
    • 生成 10,000 样本的金标数据集。
  5. 可视化:在 CognitiveSpace 3D 交互式视图中展示,支持按语言(ZH/EN/DE)筛选。

项目结构与模块完成度

模块 完成度 状态
核心管道 90%
LDS 指标 90%
可视化 75% 🟡
问卷 95%
伦理合规 100%
版本控制 100%
人类数据收集 5% 🔴

合规与伦理

  • 符合 GDPR 规范(Art. 6, 7, 8, 13, 15, 16, 17, 33, 34, 77)。
  • 提供三语(ZH/DE/EN)知情同意书。
  • 包含未成年人参与保护机制。
  • 数据经过完全匿名化处理。

获取与引用

  • 项目地址https://github.com/jjjjjjjjnnjnn/BWKI-2026-LinguaGraph
  • 交互式演示CognitiveSpace 3D 可视化
  • 许可证:All Rights Reserved(仅限学术与竞赛评审非商业用途)。
  • 引用格式: bibtex @software{linguagraph2026, title = {LinguaGraph: Mapping How Language Shapes Thinking}, author = {Rong, Jiajun}, year = {2026}, url = {https://github.com/jjjjjjjjnnjnn/BWKI-2026-LinguaGraph} }
搜集汇总
数据集介绍
LinguaGraph 数据集图片
构建方式
LinguaGraph数据集基于一个严谨的跨学科研究流程构建而成。首先,研究团队收集了来自中文、英语和德语三个语种的68本教科书语料,涵盖从小学到大学的四个教育阶段。利用基于大语言模型的MIMO提示模板,从这些语料中自动提取概念及其相互关系,生成原始的JSON数据文件。随后,通过融合与去重操作,构建了包含574个概念节点和3538条关系边的多语知识图谱,并通过跨语言对齐技术为不同语言版本中的共享概念分配了30个统一标识符,最终形成了名为CognitiveSpace的认知图谱结构。
特点
该数据集的核心特色在于其开创性的语言认知量化分析能力。它首次引入了语言漂移分数这一图结构层面的指标,用于衡量不同语言使用者认知图谱之间的结构差异。数据集不仅涵盖了中文、德语、英语三种语言系统,还依托于来自30名参与者(每语种10人)针对5个主题的开放式回答数据,结合了组内与组间混合实验设计。此外,配套的3D交互式可视化工具CognitiveSpace能够直观呈现概念在不同语言和教育层次下的分布与连接模式,为探索语言相对论假说提供了全新的数据支撑。
使用方法
使用者可以通过一键式脚本快速启动全流程分析,只需在终端执行'python scripts/run_pipeline.py'命令,系统便会自动检测数据状态并依次完成概念提取、图谱构建、跨语言对齐及LDS指标计算,最终输出参与者摘要、质量报告和可视化图表。对于需要深度定制的用户,数据集提供了手动配置路径:创建虚拟环境后安装依赖、初始化SQLite数据库并导入已有数据,即可通过核心库中的模块化Python接口进行细粒度操作。可视化部分可直接在浏览器中打开本地的CognitiveSpace页面,或访问在线演示链接,以交互方式探索知识图谱。
背景与挑战
背景概述
LinguaGraph 数据集诞生于 2026 年德国联邦人工智能竞赛(BWKI 2026)的跨学科研究项目,由研究者 Jiajun Rong 主导,旨在通过人工智能与图论方法量化探索语言相对论假说——即语言是否塑造认知结构。该数据集围绕中文、英文、德文三种语言系统,构建了包含 574 个概念、3538 条关系的认知图谱,并创新性提出语言漂移分数(LDS)作为跨语言认知差异的量化指标。其核心研究问题聚焦于揭示不同语言使用者概念组织方式的系统性差异,为认知科学、计算语言学和人工智能的交叉领域提供了可验证的研究范式。该数据集通过结构化概念提取、跨语言知识图谱对齐及多学科实验设计,在语言与思维关系这一经典议题上开辟了量化实证的新路径。
当前挑战
该数据集面临的核心挑战在于精确量化语言如何影响思维结构这一高度抽象问题。具体而言,领域挑战包括:跨语言概念对齐的歧义性,因语言间不存在完美一对一映射;认知差异的图结构度量方法需同时兼顾局部与全局拓扑特征;以及如何确保 LDS 指标在不同语言群体间具有可比性而非反映文化知识差异。构建过程中的挑战则涵盖:通过 LLM 从多语语料中提取概念与关系时的噪声控制与一致性保障;跨语言本体对齐时 30 个共享概念 ID 的选取与映射校准;以及实验设计中 30 名参与者样本量在统计功效与效应量间的平衡。此外,三语知情同意、未成年人数据保护与 GDPR 合规等伦理框架的落实亦增加了实施复杂度。
常用场景
经典使用场景
LinguaGraph数据集的核心价值在于为探究语言相对论假说提供了量化工具与实验基准。其最经典的使用场景是作为跨语言认知差异分析的黄金标准,研究者可利用其中的10万条人工标注样本,结合LDS(语言漂移分数)指标,系统性地比较中文、英语、德语母语者在同一知识领域内的认知图谱结构差异。该数据集特别适用于验证不同语言系统如何影响概念层级组织的拓扑形态,为计算语言学与认知科学的交叉研究奠定了可重复验证的实证基础。
衍生相关工作
围绕LinguaGraph已衍生出一系列具有影响力的系统性工作。核心创新LDS指标被进一步扩展为包含LCD与概念Shift的多维认知差异度量体系,相关方法论发表于多篇计算语言学会议论文。基于该数据集的MML Runtime框架成功实现了技术资产跨场景复用,将核心组件适配至游戏叙事生成与语义角色标注等下游任务。此外,研究团队开展的30人三语对照实验及其统计功效分析,为后续跨语言认知研究提供了实验设计模板,而CognitiveSpace的三维可视化方案已成为知识图谱交互探索的经典范例。
数据集最近研究
最新研究方向
LinguaGraph致力于通过图论与大型语言模型的深度融合,开辟了语言相对性假设的量化实证新范式。其核心创新在于提出了Language Drift Score(LDS)这一图结构层面的跨语言认知差异度量指标,并结合3D CognitiveSpace可视化技术,构建了涵盖中文、英语、德语三语、跨越四个教育阶段的574个概念与3538条关系的认知知识图谱。该数据集不仅在BWKI 2026竞赛中验证了大语言模型用于结构化概念提取与跨语言对齐的可行性,更通过对30名参与者的混合实验设计,为揭示语言如何塑造思维结构这一经典神经认知问题提供了可计算、可比较的数据基础,推动了认知科学与计算语言学在方法论上的交叉融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务