遇见数据集

open-phi/textbooks

收藏
Hugging Face2023-10-08 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是一个利用大型语言模型(LLMs)创建的综合性开源资源库,类似于古代亚历山大图书馆。数据集包含多种来源的样本,包括使用RAG模型参考Wikipedia或其他搜索数据生成的样本、完全合成的样本以及使用GPT-3.5和GPT-4生成的样本。数据集的特征包括主题、模型、概念、大纲、Markdown格式、领域、子领域和RAG等信息。训练集包含1795个示例,总大小为397014633字节。

This dataset is a comprehensive open-source repository built with Large Language Models (LLMs), analogous to the ancient Library of Alexandria. It includes samples from diverse sources: those generated by RAG models referencing Wikipedia or other search data, fully synthetic samples, and samples produced using GPT-3.5 and GPT-4. The dataset's features include information such as topic, model, concept, outline, Markdown format, domain, sub-domain, and RAG. The training set comprises 1795 examples with a total size of 397,014,633 bytes.

提供机构:
open-phi
原始信息汇总

数据集概述

本数据集旨在构建一个类似于历史上的亚历山大图书馆的全面开源知识库,利用大型语言模型(LLMs)来实现这一目标。

搜集汇总
数据集介绍
构建方式
在大型语言模型(LLMs)蓬勃发展的时代背景下,open-phi/textbooks数据集应运而生,旨在构建一个类似于古代亚历山大图书馆的综合性开源知识库。该数据集的构建方式呈现多元化特征:部分样本基于RAG(检索增强生成)模型,通过引用维基百科或其他搜索数据生成;部分则完全采用合成生成技术;此外,还分别利用了GPT-3.5和GPT-4等先进模型进行创作。具体而言,数据集包含来自Textbook Quality项目的1391个样本(约4800万令牌),这些样本通过SERP(搜索引擎结果页面)RAG技术生成编程类文本;以及来自SciPhi项目的300个样本(约3800万令牌),涵盖维基百科RAG与全合成通用教材。最终数据集共计1795个训练样本,存储大小约397MB,涵盖主题、模型、概念、大纲、Markdown格式、领域、子领域及RAG标签等丰富字段。
特点
该数据集最显著的特点在于其高质量与广泛覆盖性,堪称当代数字化的知识宝库。每个样本均包含主题(topic)、模型来源(model)、核心概念(concepts)、内容大纲(outline)、完整Markdown格式文本(markdown)、所属领域(field)与子领域(subfield)以及RAG标签(rag)等结构化信息,便于多维度检索与分析。数据集融合了RAG检索增强与全合成两种生成范式,既确保了内容的事实准确性,又拓展了知识的边界。此外,其采用GPT-3.5与GPT-4等前沿模型生成,保证了文本的流畅性与专业性。这些特性使得该数据集成为训练与评估LLMs教科书级知识理解能力的理想资源。
使用方法
使用者可通过HuggingFace数据集库直接加载open-phi/textbooks数据集,利用其提供的1795个训练样本进行模型微调、知识蒸馏或评估任务。数据集以默认配置(default)提供,数据文件位于data/train-*路径下。建议用户首先解析各字段(如markdown字段用于提取完整教材内容,field与subfield字段用于按学科筛选),以适配不同的下游应用场景。例如,针对编程领域,可结合rag标签筛选SERP RAG生成的样本;而通用教材则可通过field字段进行主题分类。此外,数据集生成代码与更广泛的集合可参考GitHub上的Library of Phi仓库,便于复现与扩展研究。
背景与挑战
背景概述
在大型语言模型(LLMs)蓬勃发展的时代,高质量、多样化的训练语料库成为推动模型性能跃升的关键基石。open-phi/textbooks数据集应运而生,由研究团队于近期构建,旨在打造一个类似亚历山大图书馆的综合性开源知识宝库。该数据集核心研究问题在于如何系统性地生成覆盖广泛学科的高质量教科书式文本,以弥补现有语料在深度与结构上的不足。通过融合RAG模型引用维基百科等外部数据、全合成生成以及利用GPT-3.5和GPT-4等先进模型产出,数据集汇聚了约1795个样本,涵盖编程、通用学科等多个领域,为语言模型在知识密集型任务中的表现提供了坚实支撑,对推动开放科学与教育智能化具有深远影响力。
当前挑战
该数据集面临的核心挑战在于领域问题的复杂性与构建过程的艰巨性。其一,所解决的领域问题聚焦于为语言模型提供结构化、教科书级别的训练文本,以克服现有语料碎片化、缺乏逻辑连贯性的缺陷,但如何确保生成内容的准确性、权威性并避免知识幻觉,仍是技术难点。其二,构建过程中遭遇多重挑战:数据来源的多样性(如RAG引用、全合成、不同模型生成)导致质量参差不齐,需精细筛选与对齐;大规模合成文本的语义一致性难以保证,尤其在跨学科概念衔接上;此外,版权与伦理合规性在引用外部资料时需严谨处理,这些挑战共同制约着数据集的可扩展性与应用可靠性。
常用场景
经典使用场景
在自然语言处理与教育科技交汇的前沿领域,open-phi/textbooks数据集以其跨越1795个高质量教科书样本的丰富语料,成为训练大型语言模型(LLMs)掌握多学科知识的理想资源。该数据集涵盖从编程到通识教育等广泛主题,每份样本均包含主题、概念提纲、完整Markdown内容及领域标注,为模型提供结构化、深度的知识注入。研究者常将其用于预训练阶段的领域知识增强,或作为检索增强生成(RAG)系统的知识库,以提升模型在科学、技术等专业领域的回答准确性与逻辑连贯性。
解决学术问题
该数据集有效应对了传统语料库中知识碎片化与深度不足的学术困境。通过整合RAG引用维基百科生成的文本、完全合成的内容以及GPT-3.5/4产出的高质量章节,它解决了LLMs在专业领域知识覆盖不均衡、缺乏系统化教材级逻辑的难题。其意义在于为学术界提供了一种可复现的范式,即利用合成数据与检索增强技术构建大规模结构化知识库,从而推动模型在问答、推理和内容生成等任务中的表现迈向更高层次,尤其为低资源领域的知识蒸馏与迁移学习开辟了新路径。
衍生相关工作
该数据集衍生了一系列开创性工作,包括Textbook Quality项目利用其1391个编程文本样本与约4800万tokens,推动了代码生成与文档理解模型的进步;SciPhi项目则通过300个通用教科书样本(约3800万tokens)探索了全合成数据在知识密集型任务中的潜力。这些工作共同构成了Library of Phi开源生态,不仅验证了合成数据在替代传统语料库上的可行性,还催生了多项关于教材质量自动评估、跨领域知识图谱构建以及多语言教科书生成的研究,深刻影响了教育人工智能领域的发展轨迹。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务