遇见数据集

tantraloka-pipeline

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

Tantraloka Processing Pipeline数据集是一个从Mark Dyczkowski的11卷本《Tantraloka》翻译与注释中构建的多层结构化数据集。《Tantraloka》是克什米尔湿婆教密续哲学的核心文本。该数据集旨在通过系统化的处理流程(包括PDF下载、OCR识别、文本解析、实体识别和层次化构建)将原始资料转化为可计算的研究资源。数据内容围绕经文(verse)组织,每节经文包含七个层次的信息:1) 天城体原文(devanagari);2) IAST音译(iast);3) 主要译文(main_meaning);4) 扩展注释(commentary);5) 学术脚注(footnotes);6) 讲座转录文本(audio_commentary,涵盖第1-3章共119讲);7) 命名实体识别结果(entities),包括文本引用、人物、神祇、哲学概念、原理(tattvas)和IAST术语六类实体。数据处理采用先进的技术基础设施:使用Chandra OCR-2模型进行梵语文字识别,在8xH100 GPU上并行处理;使用Whisper large-v3和Claude Haiku进行音频转录;整个流程通过MLflow进行实验跟踪。该数据集适用于梵语计算语言学、密续哲学数字人文研究、跨语言信息抽取、命名实体识别和宗教文本结构化分析等任务。

The Tantraloka Processing Pipeline dataset is a multi-layered structured dataset constructed from Mark Dyczkowskis 11-volume translation and commentary of the Tantraloka, a core text of Kashmiri Shaiva Tantric philosophy. This dataset aims to transform raw materials into a computable research resource through a systematic processing pipeline, including PDF downloading, OCR recognition, text parsing, entity recognition, and hierarchical construction. The data is organized around verses, with each verse containing seven layers of information: 1) Devanagari original text (devanagari); 2) IAST transliteration (iast); 3) main translation (main_meaning); 4) extended commentary (commentary); 5) scholarly footnotes (footnotes); 6) lecture transcriptions (audio_commentary, covering 119 lectures from chapters 1-3); and 7) named entity recognition results (entities), including six types of entities: textual references, persons, deities, philosophical concepts, principles (tattvas), and IAST terms. The data processing employs advanced technical infrastructure: using the Chandra OCR-2 model for Sanskrit text recognition, processed in parallel on 8xH100 GPUs; using Whisper large-v3 and Claude Haiku for audio transcription; and the entire workflow is tracked through MLflow. This dataset is suitable for tasks such as Sanskrit computational linguistics, digital humanities research in Tantric philosophy, cross-lingual information extraction, named entity recognition, and structured analysis of religious texts.

创建时间:
2026-06-03
原始信息汇总

数据集概述

  • 数据集名称:Tantraloka Processing Pipeline
  • 许可协议:Apache-2.0
  • 语言:梵语 (sa)、英语 (en)
  • 标签:sanskrit, kashmir-shaivism, tantraloka, ocr, ner
  • 配置:默认配置包含 scripts/*.py 文件(split: scripts)

数据集描述

该数据集是一个从 Mark Dyczkowski 的11卷《Tantraloka》翻译/评注中构建多层数据集的脚本集合。核心内容包括:

  • 每节诗的多层数据
    • devanagari:原始梵文诗句
    • iast:IAST 转写
    • main_meaning:主要翻译(粗体文本)
    • commentary:扩展学术讨论
    • footnotes:学术参考文献
    • audio_commentary:Dyczkowski 讲座转录(第1-3章,119场讲座)
    • entities:命名实体识别

命名实体识别 (NER) 类型

实体类型 匹配模式 示例
text_refs 基于缩写+经文编号的正则 MVV 1/15-17ab, IP 2/1/5
persons 约30位学者/评注者词典 Jayaratha, Abhinavagupta, Sanderson
deities 约25个神祇名称词典 Siva, Para, Bhairava, Kali
concepts 约50个哲学术语词典 anuttara, vimarsa, svatantrya
tattvas 正则 *tattva 模式 ragatattva, mayatattva
iast_terms 所有带IAST变音符号的斜体标签术语 dharana, pramana, samavesa

处理流程

由6个步骤组成的流水线:

步骤 脚本 描述
1 download_pdfs.py 从 HuggingFace 下载11卷PDF
2 ocr_brev.py 在单GPU上运行 Chandra OCR-2,集成MLflow
3 ocr_brev_parallel.py 跨8块H100 GPU分布式OCR
4 parse_layers.py 将HTML解析为分层片段 + NER
5 build_hierarchical.py 构建分层数据集 + 音频交叉引用
6 upload_dataset.py 上传至 HuggingFace

基础设施

  • OCR:Chandra OCR-2(datalab-to/chandra-ocr-2,5.3B 参数),运行于 Brev 8xH100
  • ASR:Whisper large-v3 + Bedrock Claude Haiku(143场讲座)
  • 追踪:MLflow

相关数据集

搜集汇总
数据集介绍
tantraloka-pipeline 数据集图片
构建方式
Tantraloka-pipeline数据集构建于Mark Dyczkowski十一卷《Tantraloka》英译与注释巨著之上,采用多阶段流水线式处理架构。首先,通过自动化脚本从HuggingFace仓库下载原始PDF文献,其后借助Chandra OCR-2光学字符识别模型在8块H100 GPU上并行执行梵文文本识别,将扫描版典籍转化为结构化HTML文档。继而经由解析脚本对HTML进行分层切割,并抽取命名实体,最终构建为包含多层级注释与音频交叉引用的层次化数据集,整个过程由MLflow进行实验追踪。
使用方法
数据集的使用依托于HuggingFace datasets库进行加载,用户可通过指定配置名称'default'直接获取处理完成的语料。其分层设计支持研究者按需提取特定注释层级(如仅取主译文与评注),或进行命名实体检索。配合配套的完整处理脚本及原始PDF与音频资料,研究者可复现全流程OCR与NER构建,亦可在其基础上针对梵文文献的文本分析、实体关系挖掘、跨模态学习等任务进行定制化扩展。
背景与挑战
背景概述
在数字人文与梵文研究的交叉领域中,经典文本的机器可读化与结构化处理始终面临巨大挑战。Tantraloka Pipeline数据集由Anamavajra Labs团队于近期创建,核心研究问题是如何将Mark Dyczkowski教授历时数十载完成的11卷《Tantraloka》英译评注本转化为多层级、富含语义标注的计算资源。该数据集不仅保留了梵文原文、拉丁转写、核心译文、学术注释与脚注,还创新性地整合了Dyczkowski本人的119场讲座音频转录,形成文本与声音的双重语义网络。通过引入基于Chandra OCR-2的光学识别、Whisper自动语音识别以及自定义命名实体识别(NER)管线,该工作将原本零散的PDF文档与录音遗产系统化为可交互、可检索的层次化语料库,对克什米尔湿婆主义哲学、梵文计算语言学及数字佛学研究均具有里程碑式的开源贡献。
当前挑战
该数据集所应对的领域核心挑战在于梵文经典的多模态与多层级信息整合难题:原始文献以11卷高密度PDF形式存在,包含复杂的字体混排(梵文天城体与英文评注交织)、手写体边注及非标准篇章编码,传统OCR在识别梵文连体字与异体符号时精度低下。在构建过程中,团队遭遇了多重技术瓶颈:首先,8块H100 GPU并行OCR时需解决分布式任务切分与结果一致性校验问题;其次,文本分层解析需精确区分诗句本体、评注与脚注的逻辑边界,并处理跨卷跨页的引用链;最后,NER识别的难点在于克什米尔密宗术语的拼写变体(如ragatattva与raga-tattva的归一化)、人物姓名非标准化缩写(如“Abh.”代指Abhinavagupta)及梵文拉丁转写中变音符号(diacritics)的自动补全与消歧。
常用场景
经典使用场景
在计算人文学科与梵文自然语言处理的交叉领域中,Tantraloka数据集为研究印度克什米尔湿婆主义哲学文本《Tantraloka》提供了前所未有的数字化研究平台。该数据集最经典的使用场景涵盖多层级文本结构解析与命名实体识别(NER)任务,研究者可基于其精细划分的八层信息——包括梵文天城体原文、IAST转写、核心意译、学术注解、脚注、音频评论及实体标注——进行端到端的文本深度分析。例如,通过数据集内置的NER标注体系,可精准识别经文中的文献引用、人物、神祇、哲学概念及Tattva范畴等六类实体,为克什米尔密宗哲学的语义网络重构提供结构化数据支撑。同时,该数据集支持从PDF下载到OCR识别、再到层级结构化构建的完整流水线复现,成为南亚古典文献数字人文研究的标杆性基准。
解决学术问题
该数据集系统性地解决了两大长期困扰南亚研究的学术难题:其一是古典梵文密教文献的多模态数字化困境,特别是如《Tantraloka》这类11卷本巨著中手写体批注与复杂排版的结构化提取问题;其二是密宗哲学概念体系的语义对齐与实体消歧挑战。通过整合Chandra OCR-2高精度识别模型与基于规则/词典混合的NER方法,数据集首次实现了对克什米尔湿婆主义哲学专有名词(如svatantrya、vimarsa)与复杂文献引用格式(如MVV 1/15-17ab)的自动标注。这一突破使学者得以系统性地追踪“能量-意识”本体论概念在整部经文中的分布模式,以及Abhinavagupta等注疏家之间的思想谱系关联,开启了基于大规模语料库的南亚非二元论哲学计量研究新范式,其影响已辐射至印度哲学史、宗教比较学与梵文数字图书馆建设等多个领域。
实际应用
在实际应用层面,该数据集已催生出一系列面向梵文教学、密宗文化传播与数字人文服务的创新工具。基于数据集的层级文本结构,教育机构可开发交互式梵文学习系统,学生能同时对照天城体原文、IAST转写与英译注释进行自适应学习。文化遗产领域,伦敦大学亚非学院(SOAS)等机构正利用该数据的NER标注构建克什米尔湿婆主义知识图谱,用于数字展览中神祇谱系与哲学流派的动态可视化。此外,数据集中包含的119场Dyczkowski讲座音频与Whisper ASR转录,为密宗修行实践的语音语料库建设奠定了基石,相关声学特征分析已被应用于传统文化仪式声音的数字化保护项目。在出版领域,自动OCR校正后的结构化文本直接支撑了《Tantraloka》多语言对照电子版的生成,使这部此前仅存于学术图书馆缩微胶片中的千年密典得以在全球范围内被访问与检索。
数据集最近研究
最新研究方向
Tantraloka-pipeline数据集代表了数字人文学科中梵文古典文本研究的范式突破,其革命性在于将11卷《Tantraloka》翻译与评注转化为多层级语义数据库。该工作巧妙融合了Chandra OCR-2高精度梵文识别、Whisper语音转录及命名实体识别(NER)技术,为克什米尔湿婆学派这一冷门哲学体系构建了包含天城体原文、IAST转写、逐行注释及学术参考文献的立体知识图谱。尤其值得关注的是,通过识别60余位学者姓名、35个神祇称谓及50个关键哲学范畴(如anuttara、vimarśa),并结合119场学术讲座的音频对齐,该数据集首次实现了对Abhinavagupta密教经典的跨模态可计算解析。这一工作不仅为南亚宗教哲学研究提供了可复现的基准数据集,更开创了将濒危手稿文本与当代数字人文方法论深度融合的新范式,对理解非拉丁字母体系的NER泛化能力具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务