遇见数据集

awesome-tibetan-canon

收藏
github2025-02-27 更新2026-06-04 收录
官方服务:

资源简介:

这是一个精心整理的藏文经典数据集和资源合集,主要涵盖电子文本(如Kangyur和Tengyur的多个版本)、图像资源(如扫描的经典网站)、社区和工具。合集旨在为研究藏文经典的学者和开发者提供集中的数据集索引和访问链接。

This is a meticulously curated collection of Tibetan classical datasets and resources, mainly encompassing electronic texts (e.g., multiple versions of the Kangyur and Tengyur), image resources (e.g., scanned classical websites), communities, and tools. It aims to provide centralized dataset indices and access links for scholars and developers engaged in research on Tibetan classical literature.

创建时间:
2018-11-02
原始信息汇总

数据集概述:Awesome Tibetan Canon

简介
该项目汇集了与藏传佛教大藏经(Tibetan Canon)相关的数据集与资源,包括电子文本、图像扫描件、社区资源等。


电子文本(Etexts)

甘珠尔(Kangyur)

  • ACIP Derge Kangyur
    • 来源:http://www.asianclassics.org/tibetan/
    • 说明:拉萨输入版本,与德格版校勘,缺失第xx卷。
  • SOAS-THL Derge Kangyur
    • 来源:http://www.thlib.org/encyclopedias/literary/canons/kt/catalog.php#cat=kt/d/0001/text/v001p1b
    • 说明:综合多个输入版本,与美国国会图书馆德格扫描版校勘,缺失第100卷末及第103卷。
  • Esukhia Derge Kangyur
    • 来源:https://github.com/Esukhia/derge-kangyur
    • 说明:基于SOAS-THL进一步使用脚本校勘并添加注释,缺失第103卷。
  • Adarsha Lithang Kangyur
    • 说明:理塘输入版本,与Adarsha扫描版校勘并添加注释。

丹珠尔(Tengyur)

  • ACIP Derge Tengyur
    • 来源:http://www.asianclassics.org/tibetan/
    • 说明:德格输入版本。
  • Esukhia Derge Tengyur
    • 来源:https://github.com/Esukhia/derge-kangyur
    • 说明:结合Namsel OCR和ACIP电子文本,与Esukhia扫描版校勘,并使用脚本进一步校勘与注释。

图像资源(Images)

甘珠尔(Kangyur)扫描件网站

  • rKTs
    • 网址:https://www.istb.univie.ac.at/kanjur/rktsneu/sub/archives.php
  • BDRC Kangyurs (legacy)
    • 网址:https://www.tbrc.org/#!rid=T2423
  • BDRC Kangyurs (BUDA)
    • 网址:http://library.bdrc.io/search?r=bdr:T2423&t=Work
  • EAP collection 570:https://eap.bl.uk/project/EAP570
  • EAP collection 039:https://eap.bl.uk/project/EAP039
  • EAP collection 310:https://eap.bl.uk/project/EAP310

丹珠尔(Tengyur)扫描件网站

  • BDRC Tengyurs (legacy)
    • 网址:https://www.tbrc.org/#!rid=T3CN2023
  • BDRC Tengyurs (BUDA)
    • 网址:http://library.bdrc.io/search?r=bdr:T3CN2023&t=Work

社区资源

  • TibetTech Slack
    • #canon 频道:https://tibettech.slack.com/messages/CDHUL2PR6/
搜集汇总
数据集介绍
awesome-tibetan-canon 数据集图片
构建方式
该数据集的构建源于对藏传佛教大藏经数字化资源的系统性梳理与整合。其核心围绕《甘珠尔》与《丹珠尔》两大经典体系,通过多方来源的电子文本与扫描图像进行交叉比对与校勘。具体而言,电子文本部分整合了ACIP、SOAS-THL、Esukhia及Adarsha等机构提供的多个版本,其中Esukhia版本在SOAS-THL基础上进一步利用脚本进行自动化校对与标注,而Adarsha版本则基于Lithang刻本与扫描件进行人工校勘。图像资源则汇集了rKTs、BDRC及EAP等项目的数字化扫描成果,覆盖多部不同版本的藏文大藏经。
特点
该数据集具备显著的多元性与互补性特征。在电子文本层面,它提供了不同版本间的交叉验证可能,如ACIP的拉萨本与SOAS-THL的德格本对照,以及Esukhia版本引入的自动化脚本校对,有效提升了文本准确性。图像资源则覆盖了从传统寺院收藏到现代数字化项目的广泛来源,包括BDRC的两种访问接口(旧版与BUDA平台),便于研究者根据需求选择。此外,数据集还通过注释信息标注了各版本的缺失卷次与校勘状态,为学术使用提供了透明化参考。
使用方法
使用者可依据研究需求灵活调用该数据集。对于文本分析,可直接从ACIP或Esukhia的GitHub仓库获取电子文本,并利用Esukhia提供的脚本进行进一步处理;对于图像研究,可通过BDRC的BUDA平台或rKTs网站浏览高分辨率扫描件。社区资源方面,推荐加入TibetTech Slack的#canon频道,以获取最新更新与技术协作。数据集的模块化结构允许研究者单独下载《甘珠尔》或《丹珠尔》的特定版本,或结合电子文本与图像进行校勘工作。
背景与挑战
背景概述
藏文大藏经作为藏传佛教文化的瑰宝,承载着千年宗教哲学、历史与医学知识,其数字化研究对于保护人类文化遗产具有深远意义。awesome-tibetan-canon数据集由国际藏学与计算语言学社区共同维护,创建于2010年代后期,核心研究机构包括亚洲经典输入项目(ACIP)、伦敦大学亚非学院(SOAS)、西藏文库(THL)及Esukhia组织等。该数据集聚焦于藏文大藏经中《甘珠尔》与《丹珠尔》的电子文本与图像资源整合,旨在解决跨版本文本比对、OCR校正及语义标注等核心问题。通过整合ACIP、SOAS-THL及Esukhia等多源版本,它已成为藏学数字人文领域的重要基础资源,推动了藏文古籍在自然语言处理与文献学交叉研究中的发展。
当前挑战
该数据集面临的核心挑战在于藏文大藏经的复杂性与构建过程的特殊性。领域问题方面,经文存在多个版本(如德格版、里塘版)间的文本差异,部分卷帙缺失(如德格《甘珠尔》第103卷),且传统排版中无标点符号、大量合体字与异体字增大了OCR识别与语义解析难度。构建过程中,跨机构协作面临数据格式不统一、版权限制及扫描图像质量参差不齐等问题,例如ACIP文本仅依赖拉萨口述校对,Esukhia版本虽采用脚本自动化校验,但仍需人工复核数以万计的古籍页面。此外,《丹珠尔》的电子化进度滞后于《甘珠尔》,且社区维护依赖分散的Slack群组协作,缺乏长期资金与标准化流程支持,制约了数据集的完整性与可持续更新。
常用场景
经典使用场景
在藏学与佛学研究领域,《awesome-tibetan-canon》数据集为学者提供了系统化的甘珠尔与丹珠尔电子文本及图像资源。其经典使用场景在于支持藏传佛教经典的数字化校勘与版本比对,研究者可借助ACIP、SOAS-THL及Esukhia等多源文本进行跨版本差异分析,从而厘清不同刻本间的文本流变与讹误规律。
解决学术问题
该数据集解决了藏文大藏经研究中长期存在的文本分散、版本混乱与获取困难等核心问题。通过整合德格版、理塘版等关键刻本的电子文本与扫描图像,它为文本批评、文献年代学及翻译史研究提供了可复验的基础数据,推动了藏文佛典的标准化与可计算化,其意义在于弥合了传统文献学与数字人文之间的鸿沟。
衍生相关工作
该数据集衍生了一系列重要工作,包括Esukhia对德格甘珠尔的脚本化校对与注释体系,以及Adarsha对理塘刻本的结构化标注。在社区层面,TibetTech Slack的#canon频道促进了学者与开发者协作,催生了基于AI的藏文文本修复工具。此外,ACIP与SOAS-THL的文本比对成果直接影响了后续的藏文数字出版标准制定,如THL的编码规范。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务