遇见数据集

Prasthānatrayī with Śaṅkara’s Bhāṣya 数字语料库

收藏
arXiv2026-07-08 更新2026-07-10 收录
官方服务:

资源简介:

该数据集是由罗摩克里希那传道会·维韦卡南达教育与研究学院创建的《Prasthānatrayī with Śaṅkara’s Bhāṣya》数字语料库,涵盖吠檀多哲学经典文本及其注释的全面数字化版本。数据集包含13个注释单元,总计2,971个可寻址的经文、偈颂和散文段落,其中注释层包含95,587个独特的表面形式,根本文本层包含36,881个经过分析的词汇出现次数,构成了规模庞大的梵语语言学资源。创建过程采用混合分析流程,结合基于规则的连音拆分引擎、92.7万词形屈折词典和大型语言模型辅助分析,并经过对抗性双重验证协议和人工专家审查循环的严格质量控制。该数据集主要应用于数字人文学科和计算梵语研究领域,旨在为学习者提供词级可查询的阅读辅助工具,解决古典梵语文本因连音结合和复杂语法结构导致的阅读困难问题,同时作为开放式教育资源支持学术研究和教学应用。

This digital corpus entitled "Prasthānatrayī with Śaṅkara’s Bhāṣya" was developed by the Ramakrishna Mission Vivekananda Educational and Research Institute, encompassing fully digitized versions of classical Vedānta philosophical texts and their accompanying commentaries. The dataset consists of 13 annotation units, with a total of 2,971 addressable sūtras, gāthās, and prose passages. The annotation layer holds 95,587 unique surface forms, while the core text layer includes 36,881 analyzed lexical occurrences, constituting a large-scale Sanskrit linguistic resource. The corpus was built using a hybrid analytical pipeline that integrates a rule-based sandhi splitting engine, a 927,000-word inflectional lexicon, and large language model-aided analysis, with stringent quality control implemented via an adversarial dual validation protocol and iterative manual expert review cycles. This dataset is primarily applied in the fields of digital humanities and computational Sanskrit research. It aims to provide learners with word-level queryable reading assistance tools to address reading difficulties arising from sandhi combinations and complex grammatical structures in classical Sanskrit texts, while serving as an open educational resource to support academic research and pedagogical applications.

创建时间:
2026-07-08
搜集汇总
数据集介绍
Prasthānatrayī with Śaṅkara’s Bhāṣya 数字语料库 数据集图片
构建方式
该语料库以吠檀多不二论奠基性文本——十部主要《奥义书》、《梵经》与《薄伽梵歌》及其商羯罗注疏——为构建对象。首先整合原始文本与注疏的数字化来源,经统一规范化处理,去除渲染伪影与零宽连字。随后构建混合分析管线:基于规则的诗律拆分引擎与权威屈折词形词典(约92.7万词形)及公共语料库确认的拆分先例相结合,对未解析词形引入大语言模型辅助分析,并采用对抗性双轮验证协议——首轮生成分析,次轮专司纠错。所有分析结果按表面词形聚合并标注置信度,最终生成自包含HTML阅读器,内嵌9.5万余条注疏表面词形的词典数据。
特点
该语料库的核心创新在于提供全文词级可交互数字阅读器。每个词均可点击,弹出窗口展示诗律拆分、形态句法分析与英文释义。尤为关键的是,因每个词均标注词元,阅读器同时充当索引辞典功能:以词典词头检索可召回该词所有屈折形式、诗律融合形式乃至复合词中内嵌形式,覆盖原文与注疏双层文本。系统还内置持久性人工校正循环,专家修正后写入覆盖层,在后续重建中永久保留,确保语料库精度随使用持续累积提升。置信度标签将分析质量分为高、中、低三档,低档输出自动并入专家审核工作流。
使用方法
该语料库以单个自包含HTML文件形式分发,无需服务器、安装或网络连接,在任意现代浏览器中离线运行。用户可直接点击任一梵文词查看分析结果,也可通过词典词头检索追踪概念在全集中的分布。搜索范围可限定于原文、注疏或特定文本单元。阅读器支持整词高亮显示,在诗律边界处仍完整标记匹配词。对于韵文文本采用诗行分列格式,散文保持连续文本。界面语言为英语,梵文以天城体呈现,适合缺乏语法训练的学生与需要精确检索工具的研究者共同使用。
背景与挑战
背景概述
Prasthānatrayī with Śaṅkara’s Bhāṣya 数字语料库由 Tamal Maharaj 于 2026 年 7 月在罗摩克里希那传道会维韦卡南达教育与研究学院计算机科学系创建,旨在解决不二论吠檀多经典文献的数字化细粒度阅读难题。该语料库涵盖十部主要奥义书、梵经与薄伽梵歌及其商羯罗注疏,共 13 个注释单元、2,971 个诗节与散文段落,包含 36,881 个根文词例与 95,587 个不同注疏表层形式。核心研究问题在于突破古典梵文连续连音(sandhi)、复合词(samāsa)与繁复经院文体对非专业读者造成的词级理解障碍,提供一种可离线运行的、逐词可点击解析的数字阅读工具。该资源对计算梵文学、数字人文学科与不二论吠檀多研究具有深远影响,为弥合传统口传教学与现代文本分析之间的鸿沟提供了可复现的方案。
当前挑战
该数据集面临多层次的挑战。首先在领域问题层面,古典梵文文本的连续连音现象导致词边界模糊,长复合词与密集的经院散文使词法切分与形态标注极为困难,学习者无法直接通过词典检索表层形式。传统上,这种能力需经年累月的师徒口传才能习得,而现有印刷版逐词注释仅覆盖薄伽梵歌等个别文本,商羯罗注疏的散文部分完全缺乏统一的词级解析工具。其次在构建过程中,系统需处理海量异质文本:根文与注疏的语体差异、引用标记的识别与剥离、以及约 95,587 个不同表层的唯一分析。研究团队采用了基于规则的交界切分引擎、权威词形词典与语料库验证相结合的方法,并引入大语言模型辅助分析,但 LLM 的自信错误需通过对抗性双通验证协议与人工专家复审循环来约束,确保低置信度输出得到持续的专家修正并永久存档。
常用场景
经典使用场景
在梵语计算语言学与数字人文研究交汇的前沿领域,Prasthānatrayī with Śaṅkara's Bhāṣya 数字语料库因其对不二论吠檀多经典的精深覆盖和词级注释,成为智能文本分析与古典哲学交叉研究的典范资源。该数据集最经典的使用场景是作为梵语连音分割(sandhi-viccheda)与形态句法分析的标准化基准,研究者通过该语料库检验规则引擎、深度学习模型在复合词解析和词干还原任务上的泛化能力。同时,它被广泛用于构建面向低资源古典语言的自动标注系统,尤其是针对有着复杂音韵融合和高度屈折变化的梵语散文体注释文本,为计算语言学家提供了一组封闭而高价值的黄金标准数据。
解决学术问题
长期以来,学术界面临一个结构性困境:不二论吠檀多经典本身密集的连音规则、冗长的复合词结构以及注释文本复杂的句法嵌套,使得非专业读者乃至初学者难以进行逐词解构,而传统纸质注释本仅覆盖《薄伽梵歌》等少数文本,且通行的数字文本缺乏统一的词级语法标注。该数据集通过构建涵盖十三部注释单元、包含近十万不同语料表面形态的全量逐词分析语料库,首次以系统化、可重复的工程方法打破了这一壁垒。它解决的核心学术问题是如何在一组特定且规模宏大的古典哲学语料中实现可靠的词汇分割与形态标注,并为自动分析结果的信度评估提供了分层置信度框架。这一资源的问世使得从文本表面深入语义底层的研究从手工业式操作跃入可复现的数字范式,为比较哲学、语料库语言学和共时音韵学研究开启了新的实证路径。
衍生相关工作
围绕这一语料库,学界已涌现出一系列衍生性的经典工作。其中最为核心的是该数据集所催生的混合分析管线,即规则驱动的沙达连音分割引擎与基于大语言模型的对抗性验证协议的结合,这种确定性优先、深度神经模型辅助、并由领域专家审校闭环的多层架构,已被后续多个低资源古典语言处理项目采纳为方法论模板。此外,数据发布者公开的全局词典与置信度分层评估机制,为衡量梵语自动分析系统在真实语料上的退化边界提供了可复用的评测基准;而专家审校叠加层的设计理念则启发了多种持久化人机协作标注系统。在更广阔的数字人文领域中,该语料库的词级标注数据已被用于训练面向梵语散文体注释文本的词性标注器和依存句法分析器,并作为共时音韵学中连音规则频率统计的稳定参照,推动了对古典印度哲学文本计算性解读的体系化探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务