遇见数据集

china-textbook-2021-hf

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

本数据集是中国教育部审定的中小学教科书PDF合集资源库,覆盖从小学到高中的各年级教材。数据来源于TapXWorld/ChinaTextbook项目,经过自动处理将原始碎片化的PDF文件(如分片文件)合并为完整版本,并托管在Hugging Face Datasets平台上以便访问和使用。数据集按照学段(如小学、初中、高中)、学科、版本和年级进行分层组织存储,文件命名遵循“义务教育教科书·<学科> <年级> <册>册.pdf”或类似格式,确保结构清晰和可检索。处理过程中通过专门的Rust合并器实现了PDF文件的自动合并与去重,保证每个教材仅保留一份完整版本。数据集适用于教育研究、课程分析、自然语言处理(如文本提取)等非商业用途的个人学习与研究场景,原始数据版权归各出版机构所有,使用时应遵守相关许可限制。

This dataset is a resource library containing PDF collections of Chinese primary and secondary school textbooks approved by the Ministry of Education, covering textbooks from elementary to high school grades. The data originates from the TapXWorld/ChinaTextbook project and has been automatically processed to merge original fragmented PDF files (such as split files) into complete versions, hosted on the Hugging Face Datasets platform for easy access and use. The dataset is organized hierarchically by educational stage (e.g., primary, junior high, high school), subject, version, and grade, with file naming following formats like 义务教育教科书·<Subject> <Grade> <Volume>册.pdf to ensure clear structure and retrievability. During processing, a dedicated Rust merger was used for automatic PDF merging and deduplication, ensuring only one complete version per textbook is retained. It is suitable for non-commercial personal learning and research purposes, such as educational research, curriculum analysis, and natural language processing (e.g., text extraction). The original data copyright belongs to the respective publishing institutions, and usage should comply with relevant licensing restrictions.

创建时间:
2026-07-05
原始信息汇总

数据集名称

China Textbook 2021

语言

中文

数据集简介

本数据集收录中国教育部审定的中小学教科书PDF合集,覆盖小学到高中各年级。原始数据来源于 TapXWorld/ChinaTextbook,由项目代码自动合并碎片化文件后托管于Hugging Face Datasets。处理代码位于 GitHub仓库

数据结构

教材按学段、学科、版本、年级分层组织,目录结构如下:

小学/ ├── ... 初中/ ├── ... 初中(五•四学制)/ ├── ... 小学(五•四学制)/ ├── ... 高中/ └── ...

文件名格式示例:义务教育教科书·<学科> <年级> <册>册.pdf

处理说明

  • 上游PDF存在碎片化存储(如 .1.2 分片),通过 Rust 合并器 自动合并为完整文件。
  • 部分教材同时存在完整PDF和 _merge_folder 分片,合并器按优先级去重,确保每个文件仅保留一份完整版本。

使用方式

通过命令行下载至本地: shell pip install "huggingface_hub[cli]" hf hub download RainPPR/china-textbook-2021-hf --local-dir ./data

通过Python加载数据集(流式模式): python from datasets import load_dataset ds = load_dataset("RainPPR/china-textbook-2021-hf", streaming=True)

许可说明

  • 原始数据版权归各出版机构所有。
  • 本数据集仅供个人学习、研究使用,禁止用于商业用途。
  • 项目代码采用MIT许可。
搜集汇总
数据集介绍
china-textbook-2021-hf 数据集图片
构建方式
本数据集汇聚了中国教育部审定的小学至高中各阶段教科书PDF文件,其原始资料来源于TapXWorld/ChinaTextbook仓库。针对上游数据中存在的碎片化存储问题,本项目采用Rust语言编写的合并器,自动将分散的`.1`、`.2`等分片文件整合为完整的PDF文档,并依据优先级对同时存在完整文件与分片文件夹的教材进行去重处理,最终确保每份教材仅保留一个完整版本,托管于Hugging Face Datasets平台。
使用方法
用户可通过huggingface_hub命令行工具直接下载整个数据集至本地,执行`hf hub download RainPPR/china-textbook-2021-hf --local-dir ./data`命令即可。同时,借助datasets库,能够以流式方式加载数据,如`load_dataset("RainPPR/china-textbook-2021-hf", streaming=True)`,实现高效的文件读取与处理。该数据集适用于文本分析、教育内容挖掘等研究场景,但需注意其版权归属于各出版机构,仅供个人学习与研究使用。
背景与挑战
背景概述
随着教育信息化的深入发展,数字教材在智能教育、自然语言处理与多模态学习中扮演着日益重要的角色。然而,高质量、结构化的中文教科书数据长期稀缺,限制了相关领域的研究进展。为此,研究人员基于TapXWorld/ChinaTextbook的原始资料,于2024年构建了china-textbook-2021-hf数据集,由RainPPR等机构主导。该数据集汇集了中国教育部审定的中小学教科书PDF,覆盖小学至高中各学段,按学科、版本及年级进行分层组织,为OCR识别、教材问答、教育知识图谱构建等任务提供了系统化的基础资源,对中文教育NLP领域具有显著的推动作用。
当前挑战
该数据集所面临的核心挑战包括三个方面。其一,教材版权与使用边界的界定:原始PDF版权归属于各出版机构,如何在遵循法律的前提下平衡科研与商业用途,是长期困扰研究者的难题。其二,数据碎片化与完整性问题:上游数据存在大量分片存储文件(如.1、.2后缀),部分教材同时包含完整PDF与分片文件夹,合并与去重过程需设计审慎的优先级规则,以确保数据一致性。其三,多层级结构的规范性:教材涉及学制差异(五四制与六三制)、版本更迭及学科分类,构建统一且无歧义的目录体系对后续自动化处理提出了严苛要求。
常用场景
经典使用场景
在自然语言处理与教育技术领域,教科书语料被视为构建领域知识库与训练语言模型的高质量资源。本数据集收纳了中国教育部审定的小学至高中全学段教科书PDF,覆盖多个学科与版本,为研究者提供了结构清晰、来源权威的中文教育文本集合。其经典用途在于训练面向教育场景的预训练语言模型,例如针对数学、语文、英语等不同学科的知识理解与问答系统,亦可支撑教材内容检索、知识点自动抽取、习题生成等任务,为智能教育应用奠定坚实的数据基础。
解决学术问题
该数据集的问世有效缓解了中文教育领域高质量标注语料匮乏的困境。长期以来,教材资源的数字化碎片化严重,且版权限制导致研究者难以获取完整、规范的教科书文本。本项目通过自动化合并技术,将散落的PDF碎片整合为完整文件,并按照学段、学科、版本、年级进行系统分层,使得跨教材、跨年级的知识图谱构建、课程内容对齐分析以及基于教材的阅读理解研究成为可能,推动了教育数据开放与学术研究的规范化进程。
实际应用
在实际应用层面,本数据集可赋能多种教育科技产品。例如,开发基于教材知识的智能辅导系统,帮助学生通过自然语言交互查询课本知识点;构建教师备课辅助工具,自动提取各章节重点与习题答案;整合入自适应学习平台,根据学生所在年级与学科,精准推送匹配的教材内容进行复习与练习。此外,该数据集亦可用于教育机器人对话系统,使其回答更贴合国家课程标准,从而提升智能教育产品的实用性与可信度。
数据集最近研究
最新研究方向
本数据集聚焦中国基础教育阶段教育部审定教科书的数字化整合,为自然语言处理、教育人工智能及文化传承研究提供了结构化、多学科的语料资源。在生成式AI与教育信息化深度融合的浪潮下,该数据集可支撑教材内容语义解析、跨学段知识图谱构建、以及面向中小学的智能辅导模型训练,尤其服务于中文文本理解与中华文化知识的挖掘。同时,其在OCR优化、大规模文档去重与格式标准化方面的处理经验,为同类教育资源的开放获取与数智化转型树立了标杆,呼应了知识平等与教育数字化协同发展的时代议题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务