遇见数据集

yashnbx/gita_supersite_dump

收藏
Hugging Face2023-10-22 更新2024-03-04 收录
官方服务:

资源简介:

该数据集来源于gitasupersite.iitk网站,包含了《薄伽梵歌》的多种翻译和注释版本。数据集的特征包括shloka_id、chapter、sutra等字段,以及多个翻译和注释的列,如Hindi Translation By Swami Ramsukhdas、Sanskrit Commentary By Sri Shankaracharya等。此外,数据集还包含了不同脚本的列,如Devanagari、Assamese、Bengali等。数据集的训练集包含701个样本,总大小为31628579字节。

This dataset is sourced from the website gitasupersite.iitk, and contains multiple translated and annotated versions of the *Bhagavad Gita*. Its features include fields such as shloka_id, chapter, sutra, as well as multiple columns dedicated to translations and commentaries, such as Hindi Translation By Swami Ramsukhdas, Sanskrit Commentary By Sri Shankaracharya, and others. Additionally, the dataset includes columns for different writing systems, including Devanagari, Assamese, Bengali, and more. The training split of the dataset contains 701 samples, with a total size of 31628579 bytes.

提供机构:
yashnbx
原始信息汇总

数据集概述

数据集信息

特征

  • shloka_id: 字符串类型
  • chapter: 字符串类型
  • sutra: 字符串类型
  • trans-htrskd: 字符串类型,描述:Hindi Translation By Swami Ramsukhdas
  • trans-httyn: 字符串类型,描述:Hindi Translation By Swami Tejomayananda
  • trans-hcchi: 字符串类型,描述:Hindi Commentary By Swami Chinmayananda
  • trans-hcrskd: 字符串类型,描述:Hindi Commentary By Swami Ramsukhdas
  • trans-scang: 字符串类型,描述:Sanskrit Commentary By Sri Abhinavgupta
  • trans-scram: 字符串类型,描述:Sanskrit Commentary By Sri Ramanujacharya
  • trans-scanand: 字符串类型,描述:Sanskrit Commentary By Sri Anandgiri
  • trans-scval: 字符串类型,描述:Sanskrit Commentary By Sri Vallabhacharya
  • trans-scms: 字符串类型,描述:Sanskrit Commentary By Sri Madhusudan Saraswati
  • trans-scsri: 字符串类型,描述:Sanskrit Commentary By Sri Sridhara Swami
  • trans-scvv: 字符串类型,描述:Sanskrit Commentary By Sri Vedantadeshikacharya Venkatanatha
  • trans-scpur: 字符串类型,描述:Sanskrit Commentary By Sri Purushottamji
  • trans-scneel: 字符串类型,描述:Sanskrit Commentary By Sri Neelkanth
  • trans-scdhan: 字符串类型,描述:Sanskrit Commentary By Sri Dhanpati
  • trans-ecsiva: 字符串类型,描述:English Commentary By Swami Sivananda
  • trans-etsiva: 字符串类型,描述:English Translation By Swami Sivananda
  • trans-etpurohit: 字符串类型,描述:English Translation By Purohit Swami
  • trans-etgb: 字符串类型,描述:English Translation By Swami Gambirananda
  • trans-setgb: 字符串类型,描述:English Translation Of Sri Shankaracharya By Swami Gambirananda
  • trans-etssa: 字符串类型,描述:English Translation By Dr. S. Sankaranarayan
  • trans-etassa: 字符串类型,描述:English Translation of Abhinavguptas Sanskrit Commentary By Dr. S. Sankaranarayan
  • trans-etradi: 字符串类型,描述:English Translation of Ramanujacharyas Sanskrit Commentary By Swami Adidevananda
  • trans-etadi: 字符串类型,描述:English Translation By Swami Adidevananda
  • trans-htshg: 字符串类型,描述:Hindi Translation Of Sri Shankaracharyas Sanskrit Commentary By Sri Harikrishnadas Goenka
  • trans-scsh: 字符串类型,描述:Sanskrit Commentary By Sri Shankaracharya
  • trans-scjaya: 字符串类型,描述:Sanskrit Commentary By Sri Jayatirtha
  • trans-scmad: 字符串类型,描述:Sanskrit Commentary By Sri Madhvacharya
  • script-dv: 字符串类型,描述:Devanagari
  • script-as: 字符串类型,描述:Assamese
  • script-bn: 字符串类型,描述:Bengali
  • script-gu: 字符串类型,描述:Gujarati
  • script-pa: 字符串类型,描述:Gurmukhi
  • script-kn: 字符串类型,描述:Kannada
  • script-ml: 字符串类型,描述:Malayalam
  • script-or: 字符串类型,描述:Odia
  • script-ro: 字符串类型,描述:Roman
  • script-ta: 字符串类型,描述:Tamil
  • script-te: 字符串类型,描述:Telugu

数据分割

  • train: 包含31628579字节,701个样本

数据集大小

  • 下载大小: 11660830字节
  • 数据集大小: 31628579字节

大小分类

  • n<1K
搜集汇总
数据集介绍
yashnbx/gita_supersite_dump 数据集图片
构建方式
在印度哲学与宗教研究的数字化浪潮中,《薄伽梵歌》作为印度教核心经典,其多语种、多注释版本的整合需求日益凸显。yashnbx/gita_supersite_dump数据集源自IIT Kanpur运营的gitasupersite.iitk.ac.in平台,通过系统化的网络爬取与结构化处理构建而成。数据集的构建流程包含从原始网站提取每节经文(shloka)的唯一标识符、所属章节及经文原文,并系统收录了跨越梵语、印地语和英语的二十七种权威翻译与注释文本,涵盖商羯罗、罗摩努阇、摩陀婆等历代大师的疏解。同时,数据集还整合了十一种印度本土文字的转写版本,包括天城体、孟加拉文、泰卢固文等,为跨语言比较研究提供了统一的数据基底。
特点
该数据集最显著的特征在于其跨越语言、学派与时代的综合性。它同时囊括了梵语原文、印地语及英语的直译与注释,并特别收录了商羯罗、罗摩努阇、摩陀婆等不同吠檀多学派大师的梵文疏解,为学术研究提供了多元诠释视角的平行语料。此外,数据集还提供了十一种印度文字的转写版本,极大便利了区域语言学者与文本校勘工作。701条样本覆盖了《薄伽梵歌》全部十八章,每条记录均以统一的结构化字段呈现,便于机器处理与跨版本比对。
使用方法
研究者可通过HuggingFace Datasets库直接加载该数据集,利用其结构化的shloka_id与chapter字段进行经文定位与章节筛选。对于自然语言处理任务,可选取特定翻译列(如trans-etgb)构建平行语料,用于机器翻译或跨语言语义分析。文本分析方面,可结合多个注释版本进行语义消歧或注释风格对比研究。此外,script系列字段支持将经文转换为不同文字系统,适用于多文字识别或书法风格分析。数据集以单训练集划分提供,可直接用于监督学习或检索增强生成场景。
背景与挑战
背景概述
《薄伽梵歌》作为印度教最核心的哲学经典之一,承载着千年文明的思想精髓。由印度理工学院坎普尔分校(IIT Kanpur)发起的Gita Supersite项目,旨在系统性地整合这部圣典的多语言、多注疏版本,为学术研究与文化传承提供数字化基础设施。该数据集由yashnbx于2023年创建,从官方站点抓取并结构化整理了701条经文条目,每条记录不仅包含梵文原文及天城体、孟加拉文、古吉拉特文等十一种书写系统的转写,更汇集了自商羯罗、罗摩努阇至近现代斯瓦米·希瓦南达等二十余位权威学者的梵语、印地语及英语注疏与翻译。这一数据集的问世,标志着印度古典文献数字化领域的重要进展,为计算语言学、比较哲学及宗教文本分析提供了前所未有的标准化语料资源。
当前挑战
该数据集所面临的挑战多维而深刻。在领域问题层面,其核心在于如何利用自然语言处理技术实现跨语言、跨注疏传统的语义对齐与知识抽取,例如自动识别不同学派对同一偈颂的诠释差异,或构建多语种平行语料以支持机器翻译与双语词典编纂,这对现有模型处理低资源语言与高度专业哲学文本的能力构成严峻考验。在构建过程中,数据采集需从动态网页中精确提取结构化信息,应对编码不一致、特殊字符转义及多层级嵌套注释等格式难题;同时,确保不同来源的译文与注疏在元数据层面准确关联,避免因版本混淆导致的数据污染。此外,维护数据的版本更新与版权合规性,亦是长期运营中不可回避的挑战。
常用场景
经典使用场景
《薄伽梵歌》作为印度教哲学的核心经典,其文本的多语言、多注释特性使其成为计算语言学与宗教文本数字人文研究的理想对象。该数据集收录了701节偈颂,涵盖梵文原文、十一种天城体及地方文字转写,以及来自商羯罗、罗摩努阇等十八位古代注疏家的梵文、印地语和英语译注,为跨语言文本对齐、多版本平行语料库构建提供了标准化基础。研究者可借此开展基于深度学习的梵文语法分析、注释者风格聚类及哲学概念跨文化映射等经典任务。
解决学术问题
该数据集系统性地解决了东方哲学典籍数字化过程中长期存在的两大难题:一是梵文原典与多种地方文字(如孟加拉文、泰卢固文)之间的转写标准化缺失,二是不同学派注释文本间的结构化关联断裂。通过统一字段设计,它使学者能够量化分析商羯罗的‘不二论’与罗摩努阇的‘殊胜不二论’在术语使用上的频率差异,或追踪‘业瑜伽’概念在历代注疏中的语义漂移。这种细粒度的多模态语料库,为计算哲学与知识图谱构建提供了可复现的实证基础。
衍生相关工作
该数据集已衍生出多项突破性研究,包括基于Transformer架构的梵文偈颂韵律生成模型(如‘GitaGPT’变体),以及利用对比学习对齐商羯罗与罗摩努阇注释文本的语义空间映射工作。在数字人文领域,有学者据此构建了《薄伽梵歌》注释者的社会网络分析图谱,揭示了中世纪印度教哲学流派的引用模式。此外,该数据集的文字转写字段推动了跨印度语言词向量嵌入的标准化基准测试,相关成果被用于评估多语言BERT模型在达罗毗荼语系上的表现,为低资源语言的自然语言处理提供了关键参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务