遇见数据集

darshana-graph

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

Darshana Graph是一个基于文本的印度哲学知识图谱数据集,旨在将印度主要哲学传统(包括印度教六派古典哲学、佛教大乘和上座部传统,以及耆那教核心哲学文本)映射成一个结构化的数据集。其核心特点是所有概念和关系都锚定在真实、可引用的源文本具体段落中,而非由模型先验知识生成。数据集采用封闭的、预先定义的关系词汇表,并使用大语言模型仅对给定段落中已写内容进行分类。当前版本(v3)共包含45,155条边,涵盖印度教、佛教和耆那教传统,由原始的28,322条吠檀多边、新增的16,068条大乘佛教边和765条上座部佛教边构成。数据集文件包括多个图文件(如推荐用于跨传统分析的darshana_graph_v3.jsonl)、包含125,040条记录的原始对齐文本语料库文件(darshana_corpus.jsonl),以及多个衍生分析文件(如包含时间归因和学术引用的时间源层、计算出的跨传统结构同源词对、经过词义消歧的概念出现记录等)。数据模式为JSONL格式,每条记录包含概念对、关系类型、学派、置信度、证据引用和来源等字段。关系类型包括IS_IDENTICAL_TO、IS_DISTINCT_FROM、PRESUPPOSES等。该数据集的独特之处在于,它对齐了相同根本文本的多个独立历史注释者和学派,使得同一偈颂或经文可以通过多达18位不同注释者的视角进行解读。数据集适用于哲学概念分析、跨传统比较、知识图谱构建、文本分类和问答等任务。需要注意的是,数据集存在已知局限性,如早期版本(v1)因主要从梵语吠檀多注释中提取而存在语料库组成偏差,部分传统(如上座部)的重新提取尚不完整,以及存在"general"学派标签过度使用等情况。

Darshana Graph is a text-based knowledge graph dataset for Indian philosophy, designed to map major Indian philosophical traditions (including the six classical schools of Hinduism, Mahayana and Theravada Buddhist traditions, and core Jain philosophical texts) into a structured dataset. Its core feature is that all concepts and relationships are anchored in real, citable source text passages, rather than generated from model prior knowledge. The dataset employs a closed, predefined relationship vocabulary and uses large language models to classify only the written content in given passages. The current version (v3) contains 45,155 edges, covering Hindu, Buddhist, and Jain traditions, consisting of the original 28,322 Vedanta edges, newly added 16,068 Mahayana Buddhist edges, and 765 Theravada Buddhist edges. Dataset files include multiple graph files (e.g., darshana_graph_v3.jsonl recommended for cross-traditional analysis), a raw aligned text corpus file with 125,040 records (darshana_corpus.jsonl), and several derived analysis files (such as a temporal source layer with time attributions and academic citations, computed cross-traditional structural cognate pairs, and disambiguated concept occurrence records). The data schema is in JSONL format, with each record containing fields like concept pairs, relationship types, school, confidence, evidence citations, and sources. Relationship types include IS_IDENTICAL_TO, IS_DISTINCT_FROM, PRESUPPOSES, etc. The datasets uniqueness lies in aligning multiple independent historical commentators and schools on the same root texts, allowing a single verse or scripture to be interpreted through the perspectives of up to 18 different commentators. It is suitable for tasks such as philosophical concept analysis, cross-traditional comparison, knowledge graph construction, text classification, and question answering. Note that the dataset has known limitations, such as corpus composition bias in early versions (v1) due to extraction primarily from Sanskrit Vedanta commentaries, incomplete re-extraction for some traditions (e.g., Theravada), and overuse of the "general" school label.

创建时间:
2026-06-16
原始信息汇总

Darshana Graph:印度哲学知识图谱

数据集概述

Darshana Graph 是一个结构化、基于文本的印度哲学知识图谱,涵盖印度六大古典印度教派别(darshanas)、大乘佛教、上座部佛教以及耆那教核心哲学文本。数据集中的每个概念和关系都锚定于真实、可引用的源文本段落,使用大型语言模型仅基于预定义的关系类型词汇对已有文本进行分类,不依赖模型先验知识生成内容。

当前版本(v3)包含45,155条边,涵盖印度教、佛教和耆那教传统。

语言与许可

  • 语言:英语、梵语、印地语、巴利语
  • 许可协议:CC-BY-4.0

文件结构

图谱文件

文件 边数 描述
darshana_graph.jsonl 28,322 v1原始版本,仅吠檀多注释语料库
darshana_graph_v1.jsonl 28,322 同darshana_graph.jsonl,附显式版本标签
mahayana_edges.jsonl 16,068 大乘佛教提取
pali_edges.jsonl 765 上座部巴利语提取
darshana_graph_v2.jsonl 44,390 v2版本,原始+大乘
darshana_graph_v3.jsonl 45,155 v3版本,原始+大乘+上座部
buddhist_edges.jsonl 16,833 所有佛教提取合并
jain_edges.jsonl 3,659 耆那教经典提取
non_vedic_edges.jsonl 21,257 所有非吠檀多提取合并
darshana_graph_v4.jsonl 48,814 v4版本,最完整版本

语料库文件

文件 记录数 描述
darshana_corpus.jsonl 125,040 原始对齐文本语料库,含完整巴利经典

衍生分析文件

  • temporal_source_layer.json:时间归因层,包含40个学术引用来源和约120个概念断代
  • homologues_v7.json:前200对跨传统结构同源对
  • occurrences_clustered_v3.json:52个关键哲学概念的去歧义化概念出现记录
  • darshana_temporal_v2.graphml:富时间标签的图谱文件,可直接在Gephi中打开

传统覆盖范围

传统 v1 (28,322) v2 (44,390) v3 (45,155)
印度教吠檀多
印度教数论、正理论、胜论、瑜伽
耆那教
佛教
大乘佛教
上座部佛教 ✓(部分)
耆那教经典

数据模式

每条边采用JSON格式,包含以下字段:

  • concept_a:概念A
  • concept_b:概念B
  • relation:关系类型
  • school:学派标签
  • confidence:置信度
  • evidence_quote:证据引用
  • source:来源

预定义关系类型词汇

IS_IDENTICAL_TOIS_DISTINCT_FROMIS_QUALIFIED_ASPECT_OFIS_SIMULTANEOUSLY_ONE_AND_DIFFERENTPRESUPPOSESSUBLATESLEADS_TOOBSTRUCTSIS_CAUSE_OFIS_MANIFESTATION_OFCONTRADICTS_IN_SCHOOLDEFINED_AS

注释者覆盖范围

数据集将相同根文本对齐到18位不同历史注释者和学派:

学派 包含的注释者
不二吠檀多 Shankara, Sridhara, Anandagiri, Nilakantha, Dhanpati
有限不二论 Ramanuja, Vedanta Desika, Adidevananda
二元论 Madhva
二元不二论 Nimbarka, Srinivasa(部分)
不可思议的差别与无差别 Prabhupada
克什米尔湿婆派 Abhinavagupta
新吠檀多/一般 Ramsukhdas, Tejomayananda, Purohit, Sankaranarayan

已知局限

  • 语料库构成偏差:v1图谱主要从梵语吠檀多注释中提取,佛教和耆那教概念主要以印度教注释者引用形式出现
  • 词汇证验与哲学概念区分:时间归因层记录的是最早的词汇证验,而非最早的哲学概念发展
  • 上座部重新提取不完整:pali_edges.jsonl仅包含来自15个文本文件的765条边
  • "general"学派标签过度使用:v1中约73%的边携带"general"学派标签
  • IS_QUALIFIED_ASPECT_OF关系过度代表:该关系类型相对于其他类型被过度使用
  • 无人类专家审核:所有标签均为单次LLM分类,预计精确率70-85%

来源

  • v1(吠檀多):SuttaCentral bilara-data、github.com/gita/gita、Thibaut的《东方圣书》译本、Gambhirananda、Jacobi、Vijay K. Jain
  • v2(大乘新增):心经、中论、楞伽经、法华经、维摩诘经、入菩萨行论、六祖坛经、大乘宝积经、首楞严经、金刚经注释、地藏经、净土三经
  • v3(上座部新增):来自Access to Insight和SuttaCentral的巴利经典摘录
搜集汇总
数据集介绍
darshana-graph 数据集图片
构建方式
Darshana Graph是一项致力于系统化整合印度哲学传统的知识图谱工程。其构建方式独辟蹊径,通过严格锚定于可溯源的真实文本,赋予每一个哲学概念及其相互关系以坚实的文献基础。在数据提取过程中,仅借助大语言模型对既定文本段落中已明确陈述的内容进行分类,运用预先定义且封闭的关系类型词汇表进行标识,杜绝任何依赖模型先验知识的生成行为,从而确保所有数据均源于真实文献,而非模型的臆造。
特点
该数据集实现了跨学派、跨传统的哲学思想对齐,将同一经典文本在不同历史注释家笔下的诠释并置呈现,例如18位来自不同吠檀多学派的注释者对同一偈颂的解读。其独特之处在于覆盖了印度六大正统哲学流派、大乘与上座部佛教传统以及耆那教核心典籍,并通过结构化边(edge)的形式,记录了如‘等同’、‘相异’、‘预设’、‘扬弃’等精细的哲学关系。版本迭代持续扩展宗教传统覆盖面,从最初的吠檀多语料逐步纳入大乘、上座部佛教与耆那教素材,充分体现了对宗教哲学多样性的尊重。
使用方法
用户可通过HuggingFace平台直接获取该数据集。其核心图数据以JSONL格式提供,每条记录包含两个概念节点、二者关系、所属学派、所属文本及置信度等信息,便于直接加载至Python等数据处理环境进行分析。数据集附带了详细的分析文件,包括时间归因层、跨传统结构同源对及词义消歧聚类结果,可用于探究哲学概念的起源时间、跨学派对应关系及概念传播的偏差现象。研究者可采用图神经网络、知识图谱推理或统计分析等范式,挖掘印度哲学体系内在的逻辑关联与演变脉络。
背景与挑战
背景概述
印度哲学传统源远流长,横跨数千年,涵盖印度教、佛教与耆那教等多元思想体系,然而其结构化数字资源却长期匮乏。Darshana Graph数据集由Joy Bose于2025年创建,旨在将印度六大正统哲学派别、大乘与上座部佛教及耆那教经典,构建为一个文本锚定的知识图谱。该数据集的每一概念与关系均严格源于可引证的原典段落,避免模型先验知识的生成偏差。当前版本3包含45,155条边,整合了吠檀多、大乘佛教与上座部佛教的哲学关系,为跨传统比较分析提供了前所未有的结构化资源。其影响力体现在对哲学知识图谱中归因偏见的量化研究,为计算哲学与数字人文学科开辟了新的实证路径。
当前挑战
Darshana Graph面临的首要领域挑战是哲学知识图谱固有的归因偏见,即早期版本中佛教与耆那教概念多通过印度教注释者的视角呈现,导致概念的历史溯源失真,例如‘maya’作为宇宙幻相的哲学概念实际上晚于其吠陀文献中的本义。构建过程中遭遇的挑战包括:初始版本的语料库以梵文吠檀多注释为主,造成非印度教传统的系统性偏见;上座部佛教提取尚不完整,仅765条边,大量巴利文经典尚未充分标注学派标签;约73%的早期边携带‘general’标签,无法确认具体哲学归属;关系类型‘IS_QUALIFIED_ASPECT_OF’过度使用,反映模型在不确定情况下的默认倾向;所有标注均为单次LLM分类,缺乏人工审查,估计精确率仅70%至85%。
常用场景
经典使用场景
在计算人文学科与知识图谱的交叉领域,Darshana Graph为跨传统哲学概念的结构化比较提供了里程碑式的资源。研究者可借助该数据集,将印度六大正统哲学派系、大乘与上座部佛教以及耆那教经典中蕴含的复杂概念关系,转化为可定量分析的图结构数据。其最经典的使用场景在于,通过预定义的关系词汇表(如同一性、因果性、扬弃性等),对‘空性’、‘业’、‘梵’等核心哲学术语在不同学派间的语义演化和逻辑关联进行精确建模,从而系统性剖析哲学思想的传播与变异模式。
实际应用
在实际应用中,Darshana Graph为多模态哲学教育和数字人文平台提供了底层知识基础设施。例如,它可被用于开发智能化的梵文或巴利文经典阅读助手,当学者研读《中论》时自动关联不同注释流派对‘缘起性空’的解释,并展示概念间结构同源性(如‘purusha-jiva’相似度达0.990)。此外,该数据集支撑了结构扩散模拟实验,使得研究者能够可视化哲学概念如何在历史长河中从印度河流域文明传播至东亚,从而为跨文化比较研究和语义网构建提供了一柄精准的‘考古铲’。
衍生相关工作
该数据集衍生出了多项具有理论深度的经典工作。最为突出的是其附带的‘时间层’档案与跨传统结构同源对分析,后者通过计算ego-network特征向量余弦相似度,发现了‘nirvana-samsara’(相似度0.954)等跨哲学传统的隐含对应关系,挑战了学界对印度思想与佛教思想断裂性的固有认知。同时,基于TF-IDF/SVD聚类的词义消歧工作,将‘maya’等概念从吠陀魔法力量、不二论宇宙幻象到大乘佛教语境进行精细分层,开创了哲学概念语义场自动辨析的新方法论。这些成果共同推动了从‘单文本注释’到‘多传统对话’的学术转向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务