遇见数据集

diabolic6045/Sanskrit-shlok-collection

收藏
Hugging Face2025-09-11 更新2025-10-25 收录
官方服务:

资源简介:

该数据集包含了9个不同的梵文数据集,来源于梵文诗歌、Vishnu Samhita、分词梵文、罗摩衍那、图像标签、摩诃婆罗多、Bhagavata Purana、Agni Purana以及Bhavishya Purana等。数据清洗过程中移除了英文数字、字母、非梵文字符以及重复文本,保留了梵文天城文字符、标点符号、常见标点、空白字符、换行符以及零宽度连接符/非连接符。

The dataset consists of 9 different Sanskrit datasets sourced from General Sanskrit verses, Vishnu Samhita, Tokenized Sanskrit, Ramayana, Image labels, Mahabharata, Bhagavata Purana, Agni Purana, and Bhavishya Purana. The data cleaning process involved removing English numbers, letters, non-Sanskrit characters, and duplicates, while preserving Sanskrit Devanagari characters, punctuation, common punctuation, whitespace, line breaks, and zero-width joiner/non-joiner.

提供机构:
diabolic6045
二维码
社区交流群
二维码
科研交流群
商业服务