遇见数据集

Darshana Graph

收藏
arXiv2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

Darshana Graph是由独立研究员构建的一个大规模平行评论文本语料库,专注于印度古典哲学的比较研究。该数据集包含约12.5万条文本记录,核心内容涵盖印度教、佛教和耆那教哲学传统,其中巴利三藏占主导地位(114,591条),其独特价值在于约8,500条印度教和耆那教记录实现了跨学派对齐,同一原始经文与十八位不同评论家的注释被平行关联。数据主要来源于公共领域和开放许可的经典译本,如《薄伽梵歌》《梵经》等,通过系统化的对齐架构和模式设计,确保了多注释传统的直接可比性。该数据集旨在支持数字人文研究,特别是通过风格计量学和知识图谱提取等方法,深入探究不同哲学流派的论证风格、概念关系及解释传统差异。

Darshana Graph is a large-scale parallel commentary corpus constructed by independent researchers, focused on comparative studies of classical Indian philosophy. This dataset contains roughly 125,000 text records, with core content covering the philosophical traditions of Hinduism, Buddhism, and Jainism, where the Pāli Canon dominates with 114,591 records. Its unique value stems from approximately 8,500 Hindu and Jain records that enable cross-school alignment: the same original scriptures are parallelly aligned with commentaries from 18 distinct commentators. The dataset is primarily sourced from public domain and open-licensed classical translations, including works such as the Bhagavad Gita and Brahma Sutras. Through a systematic alignment framework and schema design, it ensures direct comparability across multiple commentary traditions. This corpus is intended to support digital humanities research, specifically enabling in-depth inquiries into argumentative styles, conceptual relationships, and disparities in interpretive traditions across different philosophical schools, via methodologies including stylometrics and knowledge graph extraction.

提供机构:
独立研究员
创建时间:
2026-06-17
搜集汇总
数据集介绍
Darshana Graph 数据集图片
构建方式
Darshana Graph语料库的构建基于公开领域或开放许可的经典文献翻译,涵盖印度教、佛教和耆那教三大哲学传统,共收录超过12.5万条文本记录。其核心创新在于构建了一个约8500条记录的子集,将同一根本经文(如《梵经》中的偈颂或箴言)与来自十八位历史评注者、横跨五大学派(如吠檀多内部的不同分支)的平行注释进行对齐。每条记录采用统一架构,同时存储原文(梵文或巴利文)及英文翻译,并标注评注者、学派归属及语言信息,从而实现了异见传统对同一源文本的直接比较。
特点
该数据集最显著的特点是其跨学派平行对齐结构,这在现有数字化资源中独一无二——既不同于单一文本、单一译者的传统语料库,也超越了仅聚合多译本但不结构化哲学主张的现有平台。数据集的规模虽以巴利藏经为主体(占91.6%),但真正具有区分度的核心贡献在于其结构独特的印度教和耆那教子集,该子集使得对同一经文的不同哲学解读得以并列呈现。此外,数据集附带了一个从文本中提取的概念关系知识图,为分析跨学派哲学分歧提供了结构化基础。
使用方法
研究人员可通过公开的HuggingFace仓库获取完整语料库及提取的关系图,并利用提供的代码复现两项分析:其一是无需机器学习的文体测量比较,通过计算引经密度、反驳频率、句子复杂度等简单统计量来刻画不同评注者的论证风格差异;其二是基于受限大语言模型的哲学概念关系抽取,通过预定义封闭词汇表及事后验证机制确保提取结果的可靠性。该数据集既支持传统的比较哲学文献研究,也为数字人文学者提供了探索跨学派思想争议的可量化框架。
背景与挑战
背景概述
Darshana Graph 数据集由 Joy Bose 于近期独立构建并发布,旨在弥合古典印度哲学研究中数字资源匮乏的鸿沟。该数据集汇聚了超过 125,000 条文本记录,横跨印度教、佛教与耆那教三大哲学传统,核心材料源自《薄伽梵歌》《梵经》《奥义书》、巴利藏经及耆那教根本经典等公共领域的英译文献。其独到之处在于,约 8,500 条印度教与耆那教记录实现了同一根本经文在跨越五个吠檀多学派及十八位历史注释者之间的对齐,使研究者能够直接比较不同解释传统对相同原始材料的解读差异。这一跨注释者对齐结构在规模与系统性上填补了现有资源的空白,为数字人文视域下的比较哲学研究提供了前所未有的结构化数据基础。
当前挑战
该数据集面临的核心领域挑战在于,古典印度哲学并非单一传统,而是多个学派跨越千年的持续论辩,同一经文在不同注释者笔下可能导出截然不同的形而上学结论,而现有机器可读资源往往仅呈现单一翻译与单一观点,无法捕捉这种内在的诠释张力。构建过程中亦遭遇多重技术困境:多源爬取流水线中的标识符碰撞曾导致某源文件 1,043 条记录被静默缩减为 6 条独特标识,需通过覆盖审计与全局标识再生加以修正;注释者文本质量参差不齐,大量段落缺乏标准句末标点,迫使采用固定宽度降级方案计算句级统计量,从而削弱了部分指标的可信度;此外,约 70% 的概念关系边仅携带笼统的学派归属,而关系类型 IS_QUALIFIED_ASPECT_OF 因模型默认倾向而过度表征,二者共同制约了跨学派分歧分析的精度与图谱的可靠性。
常用场景
经典使用场景
Darshana Graph作为首个大规模跨学派对齐的印度哲学平行评注语料库,最经典的应用场景在于比较哲学研究。该数据集将《梵经》《薄伽梵歌》等核心原典的同一经文或偈颂,与横跨五个吠檀多学派及耆那教传统的十八位历史评注家的阐释进行结构化对齐,使研究者能够直接比较不同解释传统对相同源文本的差异性解读。这一对齐结构超越了传统单文本、单译者的数字资源局限,为定量分析印度哲学史上长达千年的教义辩论提供了前所未有的数据基础。
实际应用
在实际应用层面,Darshana Graph为数字人文研究者和印度哲学学者提供了一个可直接查询和计算的分析平台。它被用于自动提取哲学概念间的类型化关系,构建可追溯、可审计的知识图谱,从而辅助学者快速定位特定学派对某一哲学命题的立场及其文本证据。此外,该数据集的构建流程——包括多源爬取、标识符去重、跨语言文本对齐等——为其他多传统、多评注的数字语料库建设提供了方法论参考。其开放许可的发布方式也便于其他研究团队进行二次开发和扩展。
衍生相关工作
围绕Darshana Graph衍生了多项具有方法论启发意义的经典工作。论文中基于文体计量学的分析直接推动了可解释、无需机器学习的论证风格比较范式,为后续研究提供了透明可复现的统计指标。而约束性大语言模型知识图谱提取管道——采用封闭词汇表与事后验证机制的设计——则成为哲学文本结构化抽取领域的重要参照,为后续类似项目如何避免幻觉、提高提取可审计性提供了实践案例。此外,论文坦诚报告的提取失败模式,包括通用学派标签过度使用、关系类型分配失衡等问题,也为后续改进基于语言模型的古代文本分析系统指明了方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务