遇见数据集

Malaysia-textbook-cleaned

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集是马来西亚教育部(KPM)出版的KSSR和KSSM教材的清洗版文本。原始数据来自Scicom-intl/Malaysia-Textbook,该数据集将PDF格式的教材通过Qwen3-235B-A22B-Instruct-2507模型转换为文本,涵盖马来语、中文、英语、泰米尔语和阿拉伯语/爪夷文科目。清洗过程移除了CamScanner水印、借书承诺表(Saya Berjanji)、页脚(包括页码、出版社标记、课程标准代码、InDesign导出痕迹等)、重复行以及纯模板页面(如Rukun Negara国家原则页、封面/版权页、标题页、学校所有权印章等)。最终数据集包含25,368个页面(行),来自142本教材,内容总字节数约33.4MB。每条记录包含三个字段:page(页面编号)、content(清洗后的页面文本)、book(教材标题)。该数据集适用于文本生成任务,如教育文本分析与语言模型训练。

This dataset is a cleaned version of the KSSR and KSSM textbooks published by the Ministry of Education Malaysia (KPM). The original data comes from Scicom-intl/Malaysia-Textbook, where PDF textbooks were converted to text using the Qwen3-235B-A22B-Instruct-2507 model, covering subjects in Malay, Chinese, English, Tamil, and Arabic/Jawi. The cleaning process removed CamScanner watermarks, book borrowing pledge forms (Saya Berjanji), footers (including page numbers, publisher marks, curriculum standard codes, InDesign export traces, etc.), duplicate lines, and purely template pages (such as Rukun Negara pages, cover/copyright pages, title pages, school ownership stamps, etc.). The final dataset contains 25,368 pages (rows) from 142 textbooks, with a total content size of approximately 33.4 MB. Each record includes three fields: page (page number), content (cleaned page text), and book (textbook title). This dataset is suitable for text generation tasks such as educational text analysis and language model training.

创建时间:
2026-08-07
原始信息汇总

数据集概述:Malaysia-textbook-cleaned

基本信息

  • 数据集名称:Malaysia-textbook-cleaned
  • 维护者:Kureiwa
  • 许可证:其他(归属马来西亚教育部)
  • 语言:马来语(ms)、中文(zh)、英语(en)、阿拉伯语(ar)、泰米尔语(ta)
  • 任务类别:文本生成(text-generation)
  • 数据集来源:由 Scicom-intl/Malaysia-Textbook 清洗而来,源数据集收集了马来西亚KSSR和KSSM教材的PDF并利用 Qwen/Qwen3-235B-A22B-Instruct-2507 转换为文本。

数据规模

指标 数值
保留行数 25,368
删除行数(模板内容) 279
教材数量 142
内容大小 33,402,678 字节
Parquet 文件(zstd压缩) 10,921,845 字节

字段结构

字段 类型 描述
page int64 源教材中的页码
content string 清洗后的页面文本
book string 源教材标题(共142个唯一值)

清洗流程

数据集通过 scripts/clean.py 脚本进行清洗,主要包括以下步骤:

  1. CamScanner水印移除:删除“Scanned (with|by) CamScanner”及之后的全部内容。
  2. 教材贷款计划承诺书移除:删除固定的“SAYA BERJANJI akan menjaga buku ini ...”模板文本块及其后全部内容。
  3. 页脚/印刷前行移除:删除纯页脚内容的行,包括四类数字系统(ASCII、阿拉伯-印度数字、爪夷文、泰米尔文)的页码、出版商标记(KPM或泰米尔文标记)、课程标准代码(如 5.2.3B1S815)、InDesign/PDF导出痕迹(.indb/.indd 文件名和打印时间戳)以及阿拉伯/爪夷文页码页脚。
  4. 页内重复折叠:将连续≥3行完全相同的内容折叠为一行。
  5. 尾部页脚清理:从尾部向前删除纯页脚内容。
  6. 空白整理:去除行尾空格、合并空行、修剪首尾空白。

此外,纯为模板内容且无课程内容的整页被删除,包括国家原则(Rukun Negara)页面、封面/版权页、扉页、学校所有权印章声明页等。

使用方式

python from datasets import load_dataset

ds = load_dataset("Kureiwa/Malaysia-textbook-cleaned", split="train")

数据划分

数据集中包含一个 train 划分,包含 25,368 条样本,占用 33,402,678 字节。

许可说明

教材由马来西亚教育部(KPM)出版,重用前请检查源PDF的许可条款。

搜集汇总
数据集介绍
Malaysia-textbook-cleaned 数据集图片
构建方式
该数据集源自马来西亚教育部出版的KSSR与KSSM系列教科书,原始PDF经先进语言模型Qwen3-235B-A22B-Instruct-2507转换为文本,并在此基础上进行深度清洗。清洗流程采用纯Python标准库实现,涵盖去除CamScanner水印、教材借阅计划宣誓书、页脚与预印件痕迹,以及同类重复行的折叠。同时,过滤掉包含国家原则、封面版权、所有权印章等纯模板页面,确保数据纯净且无冗余。
特点
数据集涵盖马来语、华语、英语、泰米尔语及阿拉伯/爪夷文等多元语言,包含142本教科书、25,368条页面级文本记录。其显著特点在于高度的真实性与教育性,文本内容严格按照教材章节结构,保留了页面编号与书目信息,便于追溯源文本。经严格验证,无任何扫描水印、模板页或生产痕迹,为多语言教育研究与自然语言处理提供了高质量语料。
使用方法
使用者可通过HuggingFace的datasets库便捷加载,以默认配置获取训练集。该数据集可直接用于文本生成模型的微调、多语言教育内容分析、教科书结构研究及教育质量评估等领域。其结构简洁,包含页码、内容与书名三个字段,利于按需进行数据过滤或聚合。鉴于版权归属马来西亚教育部,利用时需参照源PDF的许可条款,合理合规地应用于学术研究或教育科技开发。
背景与挑战
背景概述
Malaysia-textbook-cleaned数据集由Kureiwa于近期创建,源于对马来西亚教育部(KPM)出版的KSSR与KSSM教材PDF进行清洗与转换的成果。该数据集覆盖马来语、华语、英语、泰米尔语及阿拉伯语/爪夷文等多元语种,核心目标是为低资源语言的自然语言处理研究提供高质量、多语种的文本语料。依托Qwen3-235B-A22B-Instruct-2507模型对原始PDF进行文本抽取,该数据集填补了马来西亚教育文本数字化资源的空白,对多语种语言建模、教育技术及东南亚语言处理等领域具有显著的推动作用,其142本教材的规模为相关研究提供了扎实的数据基础。
当前挑战
该数据集面临的核心挑战在于所解决的领域问题,即教材PDF在转换为文本时广泛存在的噪声与格式冗余,包括CamScanner水印、版权声明、页眉页脚、课程代码、导出残留及重复内容等,这些噪声严重干扰了后续语言模型的训练效果。构建过程中,清洗流程需精准识别并剔除五类语种的页脚、四种数字系统及罗马数字页码,同时处理Rukun Negara原则页、封面版权页及学校所有权印章等样板内容,还需平衡删除强度以防误删有效教学文本,最终在25,368个保留页面中实现零噪声残留,展现了严苛的数据质量工程挑战。
常用场景
经典使用场景
Malaysia-textbook-cleaned数据集汇聚了马来西亚KSSR与KSSM课程体系下的142本教科书,涵盖马来语、华语、英语、泰米尔语及阿拉伯/爪夷文等多语种内容,经细致清洗后形成逾2.5万条页面级文本记录。此数据集最经典的使用场景在于多语种自然语言处理研究与教育文本挖掘,研究者可借此开展跨语言模型预训练、低资源语言(如爪夷文、泰米尔文)的语义理解,以及教育领域文本分类、主题建模等任务。其结构化的字段设计(页码、文本、书籍)亦便于构建教科书内容检索系统,或进行课程知识点分布分析,为教育技术研究提供高质语料基础。
解决学术问题
该数据集有效回应了低资源教育文本稀缺与噪声干扰并存的学术难题。原始教材PDF经OCR转换后常夹杂CamScanner水印、页眉页脚、借书承诺书等非教学内容,严重妨碍模型训练与知识抽取。经系统性清洗,数据集去除了上述噪声,并剔除了封面、版权页及国族原则等冗余页面,确保了内容纯净度。这为研究者解决了从原始文献中提取洁净教科书语料的痛点,支持了教育人工智能中教材内容理解、知识图谱构建、以及多语种教育资源对齐等前沿课题,推动了低资源语言处理领域的实证进展。
衍生相关工作
该数据集源于对Scicom-intl/Malaysia-Textbook的二次加工,其清洗流程本身已成为一项严谨的技术实践,衍生出基于规则与统计的文本噪声去除方法。相关后续工作可能涌现于多语种教育语言模型微调、教科书内容自动结构分析、以及跨课程知识点对齐等方向。研究社区亦可借鉴其清晰的流水线设计(如DuckDB处理、Python标准库清洗),开发更具通用性的文档净化工具,从而惠及更多非英语教育语料库的构建。这些衍生工作将拓宽教育数据挖掘的边界,并促进多语种教育资源的全球化共享与研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务