遇见数据集

risale-nur-grounded-multipool

收藏
Hugging Face2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

Risale-i Nur Grounded Multi-Pool LLM Dataset 是一个专注于伊斯兰研究经典文本Risale-i Nur(由Said Nursi著)的大规模、多用途语言模型数据集。其核心特点是基于来源的,强调生成内容与原始文本的忠实对齐,包含引用和原文依据。数据规模在10万至100万样本之间,主要语言为土耳其语(拉丁字母),并保留了关键的阿拉伯语原文片段(阿拉伯文脚本)以维护文本完整性和学术准确性。数据集结构高度模块化,包含众多配置,服务于大型语言模型训练与评估的全流程,具体包括:为监督微调和直接偏好优化准备的即用型数据;适配不同训练框架的数据变体;涵盖问答、多轮对话、摘要、思维链推理等核心任务的组件;针对模型行为风格、沟通礼仪、情感重构的专项数据;以及大量深度语义任务数据,用于训练和评估模型的基于来源的推理、证据对齐、概念理解、论证流分析、长上下文多跳推理、忠实性判断等高级能力。该数据集适用于多种自然语言处理任务,如文本生成、问答、摘要、文本分类,尤其专精于检索增强生成、指令遵循、偏好学习、持续预训练以及模型输出的忠实性评估。

Risale-i Nur Grounded Multi-Pool LLM Dataset is a large-scale, multi-purpose language model dataset focused on the Islamic studies classic text Risale-i Nur (by Said Nursi). The datasets core feature is grounded, emphasizing faithful alignment of generated content with the original text, including citations and source evidence. The data scale ranges from 100,000 to 1,000,000 samples. The primary language is Turkish (using the Latin alphabet), while key Arabic original fragments (Arabic script) are carefully preserved to maintain textual integrity and academic accuracy. The dataset structure is highly modular, containing numerous configurations that serve the entire workflow of large language model training and evaluation. Specifically, it includes: ready-to-use data for supervised fine-tuning (SFT) and direct preference optimization (DPO); data variants adapted to different training frameworks (e.g., OpenAI format, TRL format); components covering core tasks such as question answering, multi-turn dialogue, summarization, and chain-of-thought reasoning; specialized data for model behavioral styles, communication etiquette, and emotional reframing; and extensive deep semantic task data for training and evaluating advanced capabilities like grounded reasoning, evidence alignment, concept understanding, argument flow analysis, long-context multi-hop reasoning, and faithfulness judgment. This dataset is suitable for various natural language processing tasks, including text generation, question answering, summarization, and text classification, with particular expertise in retrieval-augmented generation (RAG), instruction following, preference learning, continued pre-training, and faithfulness evaluation of model outputs.

创建时间:
2026-06-18
原始信息汇总

数据集概要

Risale-i Nur Grounded Multi-Pool LLM Dataset 是一个专注于土耳其语和阿拉伯语(以土耳其语为主要语言)的大型语言模型训练数据集。该数据集基于“Risale-i Nur”文本来源,通过机器生成的方式创建,旨在支持多种自然语言处理任务,包括文本生成、问答、摘要和文本分类。数据集规模在 100K 到 1M 条记录之间。

语言与许可

  • 语言: 主要为土耳其语(拉丁字母),并包含阿拉伯语(阿拉伯字母)作为源文本验证和审计用途,不用于阿拉伯语指令或生成。
  • 许可: “source-dependent”许可,详见 NOTICE.md 文件。

配置文件与数据划分

数据集提供了丰富的配置文件(configs),涵盖不同任务和应用场景,并分为训练(train)、验证(validation)和测试(test)集。主要类别包括:

大类 说明 示例配置
ready 可直接用于训练的格式化数据。 ready_sft, ready_dpo, ready_eval
provider 针对不同训练平台(如 OpenAI、TRL)优化的数据格式。 provider_openai_sft_messages, provider_trl_dpo_pairs
core 核心基础任务数据。 core_qa, core_multiturn, core_summary
behavior 行为风格与对话响应数据。 behavior_style_responses, behavior_irshad_dialogues
cpt 继续预训练(Continued Pre-training)数据。 cpt_clean, cpt_structured
native 原生土耳其语问答数据。 native_qa
arabic 阿拉伯语片段数据。 arabic_spans
deep 深度语言理解与推理数据。 涵盖问答、推理、引用、语义、检索、评估等复杂子任务。

应用标签

该数据集适用于以下技术领域:

  • 大语言模型训练与微调(SFT, DPO)
  • 指令微调与偏好数据集构建
  • 检索增强生成(RAG)与检索评估
  • 忠实度评估、硬负样本挖掘、重排序
  • 过程监督与引用溯源
  • 土耳其语模型持续预训练
搜集汇总
数据集介绍
risale-nur-grounded-multipool 数据集图片
构建方式
该数据集以伊斯兰思想家赛义德·努尔西的《光明书信集》为核心文本源,通过机器生成与人工校验相结合的方式构建。构建流程涵盖了对原始文本的深度语义拆解,包括段落层级的引用标注、概念矩阵的提取以及跨章节的推理链构建。数据集被划分为多个功能组件,如核心问答、多轮对话、摘要生成与行为偏好,每个组件均以JSONL格式存储,并进一步根据任务类型聚合为监督微调(SFT)、直接偏好优化(DPO)与评估(eval)等标准化配置,以此支持多样化的训练与评测场景。
特点
该数据集的一大特色在于其多层次的接地性(groundedness),即所有生成任务均严格绑定原始文本引用,确保输出可溯源至具体段落与概念。数据集覆盖土耳其语与阿拉伯语,尤其保留了奥斯曼土耳其语语域与阿拉伯语原文,彰显了文化完整性。此外,其丰富的配置设计——从基础的问答对到深层的忠实度判断与论证流分析——使得模型能够学习从精确引用、概念证据选择到跨章节综合的多粒度推理能力,为伊斯兰研究领域的语言模型提供了独特且严谨的训练资源。
使用方法
使用者可通过Hugging Face Datasets库加载该数据集,并依据训练目标选择相应配置。例如,对于监督微调任务,可加载'ready_sft'配置,该配置提供了统一的训练、验证与测试分片。对于偏好对齐任务,则选用'ready_dpo'配置,其包含成对的优劣响应。此外,数据集还针对不同框架(如OpenAI消息格式与TRL的prompt-completion格式)提供了预处理好的provider配置,极大简化了与主流训练流程的集成工作。用户亦可深入使用core与components系列配置,以探索特定子任务的数据结构。
背景与挑战
背景概述
Risale-i Nur Grounded Multi-Pool LLM Dataset 是一个专为大型语言模型(LLM)微调而构建的综合性数据集,创建于2024年,由致力于伊斯兰学术与自然语言处理交叉领域的研究团队开发。该数据集以20世纪伊斯兰学者赛义德·努尔西(Said Nursi)的经典著作《Risale-i Nur》为核心语料,旨在解决宗教文本在当代AI系统中的精准理解与忠实生成问题。核心研究问题包括如何使LLM在伊斯兰教义问答、文本摘要、对话生成等任务中保持对原始文本的严格忠实性(grounding),同时支持土耳其语(拉丁化)和阿拉伯语的混合处理。该数据集在伊斯兰数字人文、低资源语言NLP及受控文本生成领域具有开拓性影响,为构建符合特定信仰体系与伦理规范的可信AI提供了高质量基准。
当前挑战
该数据集面临的领域挑战在于:宗教文本的语义精微性和解释权威性要求LLM在生成时避免偏离原始教义,传统NLP任务(如摘要、问答)易产生‘幻觉’或扭曲原意,亟需通过细粒度引用锚定(citation grounding)和忠实性评估(faithfulness evaluation)来保障。构建过程中,团队需应对多重技术挑战:一是将奥斯曼土耳其语与阿拉伯文混排内容进行结构化标注,保留阿拉伯语原文的完整性(arabic integrity);二是从130余个子配置中协调监督微调(SFT)、直接偏好优化(DPO)及检索增强生成(RAG)等不同范式的数据格式;三是通过困难负样本挖掘(hard-negative mining)和过程监督(process supervision)提升模型在概念证据选择与跨段落多跳推理中的鲁棒性,从而在低资源背景下平衡数据集规模(10万至100万条)与标注精细度。
常用场景
经典使用场景
在伊斯兰学术研究与自然语言处理的交汇地带,Risale-i Nur 经典文本的现代化解析催生了这一独具特色的多池数据集。其最经典的使用场景聚焦于基于经典来源的生成式问答与摘要任务,研究者可借助该数据集训练模型在忠实于原典文意的前提下,对 Said Nursi 著作中的神学、哲学与伦理议题进行精准回答,同时完成对长篇幅论述的凝练概括。此外,该数据集为监督微调与偏好对齐提供了丰富的指令对,支持模型在伊斯兰语境下习得严谨的引证习惯与逻辑推理能力。
实际应用
在实际应用层面,该数据集赋能了一系列面向穆斯林社群的知识服务工具。最直接的落地场景是构建检索增强生成(RAG)系统,为宗教教育、教义咨询与学术研究提供可溯源的问答服务,用户提出的问题可被精准映射到典籍原文的特定段落并生成附有引文的答复。同时,该数据集可用于开发督导式的行为校准模型,在交流礼仪、情感疏导与伦理劝诫等场景中输出符合伊斯兰文化的得体回应。此外,其在跨语言阿拉伯文转写与上下文检索方面的配置,也为多模态伊斯兰文献数字化平台的建设提供了关键支撑。
衍生相关工作
围绕该数据集衍生了一系列具有开创性的研究工作。在模型训练范式上,基于其提供的偏好对数据,研究者发展出了针对宗教文本的 DPO(直接偏好优化)训练管线,有效提升了模型在教义解释中的严谨性。在评估基准方面,该数据集内置的忠实性裁判与修复、来源留出评估等配置,催生了专注于来源基座模型事实性检验的专用评估套件。更为深远的是,其中包含的概念证据选择、类比映射与修辞手法识别等深层任务,启发了将古典修辞学与现代推理链条相结合的可解释推理路径,形成了跨学科的语义精炼方法论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务