遇见数据集

NaolBM/amharic_bible_corpus

收藏
Hugging Face2025-12-10 更新2025-12-20 收录
官方服务:

资源简介:

--- dataset_info: features: - name: verse_id dtype: string - name: book dtype: string - name: chapter dtype: string - name: verse dtype: int64 - name: verse_text dtype: string - name: text dtype: string splits: - name: train num_bytes: 5488640 num_examples: 30752 download_size: 2000000 dataset_size: 5488640 configs: - config_name: default data_files: - split: train path: data/train-* language: - am license: apache-2.0 task_categories: - text-generation - fill-mask - text-classification size_categories: - 10K<n<100K pretty_name: + --- # Amharic Bible Corpus Dataset This is an open Protestant Amharic Bible corpus dataset for LLM pretraining and NLP research. ## Dataset Description This dataset contains the complete Amharic Bible text, formatted for language model pretraining. Each entry is a single Bible verse with its reference in the format: `Book Chapter:Verse Verse text`. ### Features - `text`: Complete verse text with book, chapter, and verse reference - Format: `Book Chapter:Verse Verse text` ### Dataset Structure The dataset contains a single split: - **train**: 30,752 Bible verses for training language models ### Languages - Primary language: Amharic (am) - Script: Ge'ez/Ethiopic script - Language code: am-ET ### Statistics | Metric | Count | |--------|-------| | Total Books | 66 | | Total Chapters | 1,189 | | Total Verses | 30,752 | | File Size | 5.23 MB | | Format | Parquet | ### Sample Verses 1. **ኦሪት ዘፍጥረት 1:1** - በመጀመሪያ እግዚአብሔር ሰማይንና ምድርን ፈጠረ። 2. **ኦሪት ዘፍጥረት 1:2** - ምድርም ባዶ ነበረች፥ አንዳችም አልነበረባትም፤ ጨለማም በጥልቁ ላይ ነበረ፤ የእግዚአብሔርም መንፈስ በውኃ ላይ ሰፍፎ ነበር። 3. **ኦሪት ዘፍጥረት 1:3** - እግዚአብሔርም። ብርሃን ይሁን ኣለ፤ ብርሃንም ሆነ። 4. **ኦሪት ዘፍጥረት 1:4** - እግዚአብሔርም ብርሃኑ መልካም እንደ ሆነ አየ፤ እግዚብሔርም ብርሃንንና ጨለማን ለየ። 5. **ኦሪት ዘፍጥረት 1:5** - እግዚአብሔርም ብርሃኑን ቀን ብሎ ጠራው፥ ጨለማውንም ሌሊት አለው። ማታም ሆነ ጥዋትም ሆነ፥ አንድ ቀን። ### Book Summary (First 10 Books) | Book | Chapters | Verses | |------|----------|--------| | ኦሪት ዘፍጥረት | 50 | 1,530 | | ኦሪት ዘጸአት | 40 | 1,207 | | ኦሪት ዘሌዋውያን | 27 | 855 | | ኦሪት ዘኍልቍ | 36 | 1,276 | | ኦሪት ዘዳግም | 34 | 934 | | መጽሐፈ ኢያሱ ወልደ ነዌ | 24 | 636 | | መጽሐፈ መሣፍንት | 21 | 616 | | መጽሐፈ ሩት | 4 | 85 | | መጽሐፈ ሳሙኤል ቀዳማዊ | 31 | 809 | | መጽሐፈ ሳሙኤል ካል | 24 | 691 | *And 56 more books...* ### Usage ```python from datasets import load_dataset # Load the dataset dataset = load_dataset("NaolBM/amharic_bible_corpus") # Access the training data train_data = dataset["train"] # Iterate through verses for example in train_data: print(example["text"]) # Example: "ኦሪት ዘፍጥረት 1:1 በመጀመሪያ እግዚአብሔር ሰማይንና ምድርን ፈጠረ።" # Get statistics print(f"Total verses: {len(train_data)}")

--- 数据集信息: 数据特征: - 字段名:verse_id,数据类型:字符串 - 字段名:book,数据类型:字符串 - 字段名:chapter,数据类型:字符串 - 字段名:verse,数据类型:64位整数 - 字段名:verse_text,数据类型:字符串 - 字段名:text,数据类型:字符串 数据集划分: - 划分名称:train,字节占用:5488640,样本数量:30752 下载总大小:2000000 数据集总大小:5488640 配置项: - 配置名称:default 数据文件: - 划分:train,文件路径:data/train-* 语言: - am 许可证:Apache-2.0 任务类别: - 文本生成 - 掩码填空 - 文本分类 样本规模: - 10000 < 样本数 < 100000 展示名称:+ --- # 阿姆哈拉语圣经语料库数据集 本数据集为面向大语言模型(Large Language Model,LLM)预训练与自然语言处理(Natural Language Processing,NLP)研究的开源新教阿姆哈拉语圣经语料库数据集。 ## 数据集说明 本数据集包含完整的阿姆哈拉语圣经文本,适配语言模型预训练格式。每条数据对应单节圣经经文及其引用信息,引用格式为:`书卷名 章数:节数 经文文本`。 ### 数据特征 - `text`:包含书卷、章数、节数引用信息的完整经文文本,格式为:`Book Chapter:Verse Verse text`。 ### 数据集结构 本数据集仅包含单一划分: - **训练集(train)**:包含30752节圣经经文,用于语言模型训练。 ### 语言信息 - 核心语言:阿姆哈拉语(语言代码:am) - 书写系统:吉兹/埃塞俄比亚书写体系 - 语言区域代码:am-ET ### 统计信息 | 统计指标 | 数值 | |--------|-------| | 总书卷数 | 66 | | 总章数 | 1189 | | 总节数 | 30752 | | 文件大小 | 5.23 MB | | 文件格式 | Parquet | ### 示例经文 1. **创世记 1:1** - 起初神创造天地。 2. **创世记 1:2** - 地是空虚混沌,渊面黑暗;神的灵运行在水面上。 3. **创世记 1:3** - 神说:"要有光",就有了光。 4. **创世记 1:4** - 神看光是好的,就把光暗分开了。 5. **创世记 1:5** - 神称光为昼,称暗为夜。有晚上,有早晨,这是头一日。 ### 前十卷书卷统计 | 中文书卷名 | 章数 | 节数 | |----------|------|------| | 创世记 | 50 | 1530 | | 出埃及记 | 40 | 1207 | | 利未记 | 27 | 855 | | 民数记 | 36 | 1276 | | 申命记 | 34 | 934 | | 马太福音 | 24 | 636 | | 马可福音 | 21 | 616 | | 路得记 | 4 | 85 | | 撒母耳记上 | 31 | 809 | | 撒母耳记下 | 24 | 691 | *另有56卷书卷……* ### 使用示例 python from datasets import load_dataset # 加载数据集 dataset = load_dataset("NaolBM/amharic_bible_corpus") # 获取训练划分数据 train_data = dataset["train"] # 遍历经文数据 for example in train_data: print(example["text"]) # 示例输出:"ኦሪት ዘፍጥረት 1:1 በመጀመሪያ እግዚአብሔር ሰማይንና ምድርን ፈጠረ።" # 获取数据集统计信息 print(f"总经文节数:{len(train_data)}")

提供机构:
NaolBM
二维码
社区交流群
二维码
科研交流群
商业服务