risale-nur-grounded-multipool
收藏资源简介:
Risale-i Nur Grounded Multi-Pool LLM Dataset 是一个专注于伊斯兰研究经典文本Risale-i Nur(由Said Nursi著)的大规模、多用途语言模型数据集。其核心特点是基于来源的,强调生成内容与原始文本的忠实对齐,包含引用和原文依据。数据规模在10万至100万样本之间,主要语言为土耳其语(拉丁字母),并保留了关键的阿拉伯语原文片段(阿拉伯文脚本)以维护文本完整性和学术准确性。数据集结构高度模块化,包含众多配置,服务于大型语言模型训练与评估的全流程,具体包括:为监督微调和直接偏好优化准备的即用型数据;适配不同训练框架的数据变体;涵盖问答、多轮对话、摘要、思维链推理等核心任务的组件;针对模型行为风格、沟通礼仪、情感重构的专项数据;以及大量深度语义任务数据,用于训练和评估模型的基于来源的推理、证据对齐、概念理解、论证流分析、长上下文多跳推理、忠实性判断等高级能力。该数据集适用于多种自然语言处理任务,如文本生成、问答、摘要、文本分类,尤其专精于检索增强生成、指令遵循、偏好学习、持续预训练以及模型输出的忠实性评估。
Risale-i Nur Grounded Multi-Pool LLM Dataset is a large-scale, multi-purpose language model dataset focused on the Islamic studies classic text Risale-i Nur (by Said Nursi). The datasets core feature is grounded, emphasizing faithful alignment of generated content with the original text, including citations and source evidence. The data scale ranges from 100,000 to 1,000,000 samples. The primary language is Turkish (using the Latin alphabet), while key Arabic original fragments (Arabic script) are carefully preserved to maintain textual integrity and academic accuracy. The dataset structure is highly modular, containing numerous configurations that serve the entire workflow of large language model training and evaluation. Specifically, it includes: ready-to-use data for supervised fine-tuning (SFT) and direct preference optimization (DPO); data variants adapted to different training frameworks (e.g., OpenAI format, TRL format); components covering core tasks such as question answering, multi-turn dialogue, summarization, and chain-of-thought reasoning; specialized data for model behavioral styles, communication etiquette, and emotional reframing; and extensive deep semantic task data for training and evaluating advanced capabilities like grounded reasoning, evidence alignment, concept understanding, argument flow analysis, long-context multi-hop reasoning, and faithfulness judgment. This dataset is suitable for various natural language processing tasks, including text generation, question answering, summarization, and text classification, with particular expertise in retrieval-augmented generation (RAG), instruction following, preference learning, continued pre-training, and faithfulness evaluation of model outputs.
数据集概要
Risale-i Nur Grounded Multi-Pool LLM Dataset 是一个专注于土耳其语和阿拉伯语(以土耳其语为主要语言)的大型语言模型训练数据集。该数据集基于“Risale-i Nur”文本来源,通过机器生成的方式创建,旨在支持多种自然语言处理任务,包括文本生成、问答、摘要和文本分类。数据集规模在 100K 到 1M 条记录之间。
语言与许可
- 语言: 主要为土耳其语(拉丁字母),并包含阿拉伯语(阿拉伯字母)作为源文本验证和审计用途,不用于阿拉伯语指令或生成。
- 许可: “source-dependent”许可,详见 NOTICE.md 文件。
配置文件与数据划分
数据集提供了丰富的配置文件(configs),涵盖不同任务和应用场景,并分为训练(train)、验证(validation)和测试(test)集。主要类别包括:
| 大类 | 说明 | 示例配置 |
|---|---|---|
| ready | 可直接用于训练的格式化数据。 | ready_sft, ready_dpo, ready_eval |
| provider | 针对不同训练平台(如 OpenAI、TRL)优化的数据格式。 | provider_openai_sft_messages, provider_trl_dpo_pairs |
| core | 核心基础任务数据。 | core_qa, core_multiturn, core_summary |
| behavior | 行为风格与对话响应数据。 | behavior_style_responses, behavior_irshad_dialogues |
| cpt | 继续预训练(Continued Pre-training)数据。 | cpt_clean, cpt_structured |
| native | 原生土耳其语问答数据。 | native_qa |
| arabic | 阿拉伯语片段数据。 | arabic_spans |
| deep | 深度语言理解与推理数据。 | 涵盖问答、推理、引用、语义、检索、评估等复杂子任务。 |
应用标签
该数据集适用于以下技术领域:
- 大语言模型训练与微调(SFT, DPO)
- 指令微调与偏好数据集构建
- 检索增强生成(RAG)与检索评估
- 忠实度评估、硬负样本挖掘、重排序
- 过程监督与引用溯源
- 土耳其语模型持续预训练





