遇见数据集

TamilThagaval/aimperum_kaappiyangal-kundalakesi

收藏
Hugging Face2025-12-15 更新2025-12-20 收录
官方服务:

资源简介:

Kundalakesi(குண்டலகேசி)是Aimperum Kaappiyangal(五大泰米尔史诗)之一。这部史诗以其对宗教辩论、弃绝和哲学转变的强烈关注而著称。该作品仅以片段形式存世,现今可用的诗句数量有限。本数据集提供了一个结构化的数字集合,收录了Kundalakesi所有现存的诗句,以原始古典泰米尔语形式保存,供研究和教育用途。史诗的女主角Kundalakesi出生于一个富裕的商人家庭,她的故事涉及爱情、背叛、宗教转变和哲学辩论。尽管史诗的早期生活与耆那教的弃绝有关,但最终与佛教哲学一致。目前只有19节诗句可用,这些幸存的诗句通过后来的语法和文学评论中的引用得以保存。数据集以扁平的诗句列表形式组织,每节诗句均以原始古典泰米尔语形式保存。

Kundalakesi (குண்டலகேசி) is one of the Aimperum Kaappiyangal (Five Great Tamil Epics). This epic is distinct in its strong focus on religious debate, renunciation, and philosophical transformation. The work survives only in a fragmentary form, with a limited number of verses available today. This dataset presents a structured digital collection of all the extant verses of Kundalakesi, preserved in their original classical Tamil form for research and educational purposes. The heroine of the epic is Kundalakesi, born into a wealthy merchant family, and her story involves love, betrayal, religious transformation, and philosophical debate. Although Kundalakesi’s early life is associated with Jain renunciation, the epic ultimately aligns with Buddhist philosophy. At present, only 19 verses of Kundalakesi are available, preserved through quotations in later grammatical and literary commentaries. The dataset is organized as a flat list of poems, with each verse preserved in its original classical Tamil form.

提供机构:
TamilThagaval
搜集汇总
数据集介绍
TamilThagaval/aimperum_kaappiyangal-kundalakesi 数据集图片
构建方式
在古典泰米尔文学的璀璨星空中,《Kundalakesi》作为五大史诗之一,以其独特的哲学思辨与宗教对话色彩而著称。该数据集的构建基于对现存残篇的系统性整理,所有19首诗歌均源自后世语法与文学注释文献中的引文片段。数据集采用扁平化结构组织,每条记录包含诗歌编号与原始古典泰米尔文诗句,忠实保留了这部7世纪佛教史诗的文本原貌,为碎片化史诗的数字重建提供了基础框架。
使用方法
研究者可基于该数据集开展多维度的学术探索。在自然语言处理领域,可利用其进行古典泰米尔语的词法分析、句法建模及低资源语言模型训练。文学研究者可通过诗歌序列分析,结合历史语境推演史诗的叙事脉络与哲学主题。数字人文学者则可将其作为碎片化文本重构的案例,开发比对算法或可视化工具。数据集采用MIT许可协议,支持学术与教育用途的自由使用,但需注意其依赖二手资料解读的局限性。
背景与挑战
背景概述
Kundalakesi(குண்டலகேசி)是泰米尔文学五大史诗之一,由7世纪佛教诗人Nāthakuththanār创作,现存仅19节残篇。该数据集由TamilThagaval团队于近年整理发布,旨在数字化保存这部以宗教辩论、哲学转化与女性觉醒为核心的古典文本。史诗主人公Kundalakesi从富商之女蜕变为佛教比丘尼的故事,深刻反映了古印度佛教与耆那教的思想碰撞。作为泰米尔语自然语言处理与数字人文研究的关键资源,该数据集为探索濒危古典文献的数字化重建提供了范例,推动了南印度文学遗产的现代学术转型。
当前挑战
该数据集面临的核心挑战在于文本的极度残缺性——仅存19节诗歌,完整叙事需依赖后世评注与比较文学重构,这对自然语言处理模型的语义建模构成根本性局限。构建过程中,研究人员需从分散的语法文献与文学评注中甄别、校勘原始诗句,面临版本歧义与语境缺失的双重困境。此外,古典泰米尔语的形态复杂性、佛教哲学术语的多义性,以及缺乏现代泰米尔语释义,进一步加剧了机器翻译与文本生成任务的难度。这些挑战要求跨学科协作,以平衡文献真实性与算法可计算性。
常用场景
经典使用场景
在古典泰米尔文学与数字人文学科的交汇处,TamilThagaval/aimperum_kaappiyangal-kundalakesi数据集为研究者提供了珍稀的碎片化史诗语料。其最经典的使用场景聚焦于泰米尔自然语言处理(NLP)中的低资源语言建模与文本生成任务,凭借仅存的19首古典泰米尔诗句,成为训练语言模型在残缺文本环境中进行语义补全与风格迁移的独特基准。此外,该数据集亦被广泛用于文学批评中的碎片化作品重建研究,通过对比语法与评注文献中的引文,揭示史诗原貌的蛛丝马迹。
解决学术问题
该数据集直面古典泰米尔文学研究中一个棘手的学术难题——如何系统化处理仅存片段的史诗文本。传统上,学者依赖零散的二手文献进行定性分析,而数据集通过结构化数字转录,将19首残诗转化为可计算的数据形态,解决了碎片化文本的定量可操作性问题。其意义在于为佛教与耆那教哲学对比研究提供了数据支撑,使研究者能够从语言模式中追溯宗教思想的演变轨迹;同时,它推动了低资源古典语言NLP的进步,为濒危文本的数字化保护树立了方法论典范。
实际应用
在实际应用中,该数据集主要服务于泰米尔语教育、文化遗产数字化与跨宗教哲学普及。教育机构可将其作为古典文学课程的教学资源,通过可视化工具展示史诗的韵律与修辞特征;数字人文项目利用它构建碎片化文本的语义网络,辅助学者进行作者归属与年代考证。此外,数据集还赋能文化机构开发交互式展览,例如生成诗歌的现代泰米尔语注释或英文翻译,让公众得以窥见7世纪佛教史诗的精神内核,促进多元宗教遗产的传播与理解。
数据集最近研究
最新研究方向
当前,围绕泰米尔古典史诗《Kundalakesi》的数据集研究正聚焦于数字人文与低资源语言自然语言处理的交叉领域。该数据集仅存19首残篇,为研究失传文献的碎片化重建提供了宝贵语料,尤其在泰米尔语诗歌的韵律分析、佛教与耆那教哲学文本的对比计算语言学中具有前沿价值。随着南亚古典文学数字化浪潮的兴起,研究者利用该数据集探讨宗教辩论叙事中的语义演变与情感极性,并通过小样本学习技术挖掘残篇中的主题连贯性,为濒危文本的智能补全与跨文化哲学研究开辟了新路径。这一工作不仅推动了泰米尔语NLP从现代语料向古典语料的延伸,更在文化遗产保护与计算人文学科间架起了桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务