遇见数据集

Maktabati/shamela-vectors

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

Shamela向量数据库是最大的开源向量数据库,基于完整的al-Maktaba al-Shamela伊斯兰文本语料库,专为语义搜索和检索增强生成(RAG)而设计。它包含约8至11百万个文本块,这些文本块源自8,589本经典伊斯兰书籍,以及完整的《古兰经》文本(6,236节经文,采用Hafs an Asim版本)。数据集涵盖40个伊斯兰学术类别,时间跨度从伊斯兰历1世纪到15世纪,主要语言为阿拉伯语。技术方面,使用intfloat/multilingual-e5-base模型生成768维向量,采用余弦距离度量,分块大小为512个标记,重叠50个标记。数据集字段包括原始文本、规范化文本、SHA-256哈希、作者、标题、死亡年份、语言、页面引用、字符偏移、分块索引、索引时间戳等,并包含Shamela特定字段(如来源、书籍ID、类别ID)和《古兰经》特定字段(如苏拉编号、经文编号)。数据集可用于导入Qdrant进行向量搜索,支持按来源、类别或作者过滤,适用于伊斯兰文本的语义检索和分析。

The largest open-source vector database of the complete al-Maktaba al-Shamela Islamic text corpus, prepared for semantic search and Retrieval-Augmented Generation (RAG). Includes the full Quran text (6,236 verses, Hafs an Asim). Statistics: ~8–11M chunks from 8,589 classical Islamic books, 6,236 Quran verses (one verse = one chunk), 40 categories covering the full breadth of Islamic scholarship, period: 1st century AH to 15th century AH, language: Arabic (primary). Technical details: Embedding model intfloat/multilingual-e5-base, vector dimension 768, distance metric cosine, chunk size 512 tokens, overlap 50 tokens. Dataset fields include text, text_norm, sha256, author, title, death_year, language, page, char_start, char_end, chunk_no, indexed_at, plus Shamela-specific fields (e.g., source, book_id, category_name_ar) and Quran-specific fields (e.g., surah_num, ayah_num). Usage includes import into Qdrant for semantic search with filtering by source, category, or author.

提供机构:
Maktabati
搜集汇总
数据集介绍
Maktabati/shamela-vectors 数据集图片
构建方式
在伊斯兰学术典籍数字化浪潮中,本数据集通过系统化处理al-Maktaba al-Shamela(المكتبة الشاملة)典籍库而构建。原始文本取自8,589部自公元7至15世纪的经典著作,包含完整《古兰经》6,236节经文(哈夫斯版诵读),总计生成11,482,164个文本片段。采用intfloat/multilingual-e5-base模型进行语义嵌入,向量维度为768维,距离度量采用余弦相似度。分块策略上,以512个词元为基本单元,相邻片段间设置50词元重叠,确保语境连贯性。全部嵌入与索引流程在个人消费级计算机上完成(AMD Ryzen 9 5900X处理器,32GB内存,RX 6900 XT显卡),未依赖任何云端服务,保证了流程的可复现性。
使用方法
本数据集专为语义搜索与检索增强生成(RAG)应用设计,推荐通过Qdrant向量数据库进行索引与查询。用户可下载Parquet格式文件,使用官方示例代码将向量与元数据批量导入Qdrant集合,支持向量磁盘存储与HNSW内存索引的混合配置。搜索时需对查询文本添加“query:”前缀,使用e5模型编码后发起余弦相似度搜索。支持按来源(shamela或quran)、分类名称、作者等字段进行结果过滤。配合Python与Transformers库,数行代码即可构建面向伊斯兰典籍的高精度语义搜索引擎或智能问答系统。
背景与挑战
背景概述
在伊斯兰学术研究与自然语言处理的交叉领域,大规模古典文本语料库的数字化与语义化检索一直是关键瓶颈。2026年,由maktabati.ai团队构建的Shamela Vectors数据集应运而生,旨在解决al-Maktaba al-Shamela(المكتبة الشاملة)这一包含8589部伊斯兰经典著作(时间跨度从1世纪至15世纪希吉拉历)及完整《古兰经》(6236节经文,采用哈夫斯·安·阿西姆诵读法)的巨大语料库的结构化与向量化问题。该数据集包含超过1100万个文本片段,覆盖40个伊斯兰学科分类,其创建标志着迄今为止规模最大的开源伊斯兰文本向量数据库诞生,为检索增强生成(RAG)与语义搜索在宗教文本研究中的落地提供了基础设施,对阿拉伯语自然语言处理、伊斯兰数字人文学科及可复现的学术研究具有深远影响。
当前挑战
该数据集面临的核心挑战集中于双重维度。从领域问题看,伊斯兰古典文本以阿拉伯语为主体,其语言特征包含复杂的变音符(tashkeel)、正字法变异及跨学科术语体系,传统基于关键词的检索方式极难精准捕获语义关联,亟需向量化手段实现高效的跨书籍、跨时代内容定位。从构建过程看,在消费级硬件(AMD Ryzen 9 5900X与Radeon RX 6900 XT)上对超千万个片段嵌入768维向量并建立索引,面临计算资源极度受限的挑战;此外,需确保8589部著作的元数据一致性与文本清洗(如古兰经经文保留完整变音符、其他文本归一化处理)、不同来源的页编号与卷号体系的统一映射,以及40个分类类别的合理性验证,均构成数据质量管控的严峻考验。
常用场景
经典使用场景
在伊斯兰学术研究与自然语言处理的交叉领域中,shamela-vectors数据集作为最完整的开放源代码向量数据库,被广泛用于对《综合图书馆》(al-Maktaba al-Shamela)经典伊斯兰文本语料库进行语义搜索与检索增强生成(RAG)任务。其经典使用方式是将逾千万文本块与古兰经全文的嵌入向量导入Qdrant等向量数据库,借助intfloat/multilingual-e5-base模型提取768维语义表示,通过余弦距离度量实现精准的语义匹配。研究人员可基于该数据集执行跨书籍、跨类别的深度语义检索,例如在涵盖法学、圣训、经注等40个学科的浩瀚文献中,针对特定教法问题或历史概念进行高效知识发现,亦可结合过滤条件仅检索古兰经、特定书籍或特定作者的作品,从而极大提升传统伊斯兰文献数字化研究的效率与精度。
解决学术问题
该数据集直面伊斯兰数字人文学科中长期存在的两大瓶颈:一是经典文献规模庞大(逾8500部著作,跨越15个世纪),传统关键词检索难以捕捉语义关联;二是缺乏统一、开放的向量化资源以支撑现代深度学习应用。shamela-vectors通过将全部文本分割为512个token的块并嵌入至768维向量空间,系统性解决了大规模古籍语义索引与跨文本知识融合的基础设施缺失问题。其学术意义在于首次为伊斯兰教法(Fiqh)、圣训(Hadith)、古兰经注释(Tafsir)等核心学科提供了可计算的语义表达,使研究者得以开展基于语义相似度的文献聚类、跨文本互文性分析、概念演化追踪等前沿课题。影响层面,该数据集推动了伊斯兰文本信息的检索范式从字符匹配向语义理解的跃迁,并在开放科学理念下通过CC BY 4.0许可降低了研究准入门槛,为后续基于RAG的伊斯兰知识问答系统、多语言教法推理代理等智能应用奠定了数据基石。
实际应用
在实际应用场景中,shamela-vectors已作为核心数据基础设施赋能多种伊斯兰数字服务。以maktabati.ai平台为代表的在线检索工具,允许用户通过自然语言查询直接获取来自千余部经典著作的语义匹配结果,而无需手动浏览书海。在检索增强生成(RAG)领域,该数据集被集成至智能问答系统——当用户提出教法或信仰相关问题时,系统首先在向量数据库中检索最相关的文本块作为上下文,再交由大语言模型生成兼具引证和推理的答复,显著提升回答的学术严谨性。此外,教育机构利用该数据集开发知识图谱可视化工具,辅助学生理解不同学派(如哈乃斐、沙斐仪等)的渊源关系与观点演变。个人开发者亦可在消费级硬件上复现整个嵌入与索引流程,使得伊斯兰学术知识检索技术能够以低成本、去中心化的方式广泛传播。
数据集最近研究
最新研究方向
近年来,随着检索增强生成(RAG)技术与大规模语义搜索的迅速崛起,伊斯兰经典文本的数字人文研究正经历一场深刻的范式变革。Shamela Vectors数据集作为迄今覆盖最为全面的开源伊斯兰文献向量库,整合了横跨1至15世纪、涵盖40个学科门类的8589部古典典籍以及完整的古兰经经文,以768维嵌入向量与余弦距离度量实现了对阿拉伯语古典文本的细粒度语义表征。该数据集的前沿意义在于,它不仅为宗教知识图谱的构建提供了标准化的基础资源,更通过其与OpenITI向量库的互操作模式,率先打通了跨语料、跨学科的语义查询路径,使得研究者能够在无需云端算力的情况下,于消费级硬件上复现端到端的向量索引与语义检索流程。这一突破性工作或将催生伊斯兰数字图书馆、智能教法问答系统以及古兰经经注的多模态关联分析等新型应用,其影响已然超出了单纯的自然语言处理范畴,成为数字伊斯兰研究与文化遗产智能计算交叉领域的重要里程碑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务