Indic-Data
收藏资源简介:
这是一个由各种印度来源和印度文学积累而成的数据集,包括古典印度文学文本、印度数学家的数学论文和经文、相关研究论文和数据源等。数据集目前包含的区域语言数据有古吉拉特语和马拉地语,以及英语到孟加拉语、马拉雅拉姆语、泰米尔语、泰卢固语和乌尔都语的平行语料库。
数据集概述
基本信息
- 语言: 英语(en)、印地语(hi)、梵语(sa)
- 许可证: Apache-2.0
- 标签: 印度、文学、数学、文本、语言、遗产、数学、书籍、印度语、印度数据、印地语、梵语
- 数据规模: 100M<n<1B
数据集组成
- Dharmic_Data: 包含古典印度文学文本(如《摩诃婆罗多》、《罗摩衍那》、《圣典博伽瓦谭》、吠陀等),用于分析和参考。
- Indic_Math: 包含印度数学家的数学论文和经文。
- Research: 包含与数据集相关的研究论文、数据源和文档。
- Sentence_Data: 按区域语言(如古吉拉特语、马拉地语)分列的句子级数据。
- Translations: 英语与多种印度语言(孟加拉语、马拉雅拉姆语、泰米尔语、泰卢固语、乌尔都语)的平行语料库。
数据集描述
- 数据来源于各种印度资料和印度文学。
- 使用了大量GitHub仓库和在线书籍,未来将适当致谢。
未来计划
- 计划将该数据集打造成一个涵盖所有印度语言数据的仓库,并按主题分类。
文件夹结构
Indic_data/ │ ├── .gitattributes ├── README.md │ ├── Dharmic_Data/ │ ├── Mahabharata/ │ │ ├── Critical_Edition.txt │ │ ├── Mahabharata.txt │ │ ├── Speaker.txt │ │ └── Chapters/ │ ├── Ramayana/ │ │ └── Valmiki_Ramayana.txt │ ├── Srimad_Bhagvatam/ │ │ └── devnagiri.txt │ └── Vedas/ │ ├── Indic_Math/ │ ├── Lilavati-Bhaskaracharya.md │ └── Maths-Sutra.md │ ├── Research/ │ ├── Data Sources- ALL.docx │ ├── Finetuning.docx │ ├── fpsyg-13-894774.pdf │ ├── RL.docx │ └── ssrn-4446985.pdf │ ├── Sentence_Data/ │ ├── Gujurati/ │ └── Marathi/ │ └── Translations/ ├── English-bengali/ ├── English-malyalam/ ├── English-Tamil/ ├── English-Telugu/ └── English-Urdu/




