遇见数据集

glossAPI/libiep

收藏
Hugging Face2026-06-01 更新2026-05-31 收录
官方服务:

资源简介:

LIBIEP - 历史希腊语学校教科书数据集是希腊教育政策研究所(IEP)历史教科书收藏的结构化快照,包含6,020条记录,涵盖1808年至1998年的印刷学校教科书、课程大纲和教育政策会议记录。数据集语言为希腊语,并广泛涵盖历史书面变体,如Καθαρεύουσα、Απλή Καθαρεύουσα、Δημοτική,以及少量其他语言如古希腊语、拉丁语、法语、德语、土耳其语、英语和Καραμανλίδικα。数据集分为三个子收藏:books(5,813条记录,包括教科书、学生辅助材料和教师辅助材料)、curricula(105条记录,课程大纲文档)和minutes(102条记录,历史教育委员会会议记录)。每条记录对应一个物理卷册,由IEP或其合作机构数字化并提供为可下载的PDF。元数据包括22个字段,如标题、内容(OCR提取的全文)、摘要、作者、年级、主题等。数据集规模为1.36 GB(parquet格式),包含约2.63亿单词和5.1亿令牌。数据质量注意事项包括OCR噪声、空字段、内容提取存根等。许可证为Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International(CC BY-NC-SA 4.0),仅限非商业学术和研究使用。

LIBIEP - Historical Greek School Textbooks dataset is a structured snapshot of the Historical Collection of School Textbooks of the Institute of Educational Policy (IEP) in Greece, containing 6,020 records spanning printed school textbooks, curricula, and educational-policy proceedings from 1808 to 1998. The dataset language is Greek, with extensive coverage of historical written varieties such as Καθαρεύουσα, Απλή Καθαρεύουσα, Δημοτική, plus a long tail of other languages including Ancient Greek, Latin, French, German, Turkish, English, and Καραμανλίδικα. The dataset splits into three sub-collections: books (5,813 records, including school textbooks, pupil aids, and teacher aids), curricula (105 records, curriculum and syllabus documents), and minutes (102 records, proceedings of historical pedagogical councils). Each record corresponds to a single physical volume digitized by IEP or its partner institutions and made available as a downloadable PDF. Metadata includes 22 fields such as title, content (full text extraction via OCR), abstract, author, grade, subject, etc. The dataset size is 1.36 GB (parquet format), with approximately 263.67 million words and 510.79 million tokens. Known data quality notes include OCR noise, empty bibliographic fields, PDF-extraction stubs, and other artifacts. The license is Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0), intended for non-commercial academic and research use only.

提供机构:
glossAPI
搜集汇总
数据集介绍
glossAPI/libiep 数据集图片
构建方式
LIBIEP数据集源自由希腊教育政策研究所维护的希腊历史学校教科书数字馆藏,其构建过程历经严谨的数字化与结构化处理。研究团队从33个合作机构(包括希腊议会图书馆、希腊文学与历史档案中心等)汇聚的纸质文献中,遴选出涵盖1808年至1998年间出版的6020册教材、课程纲要及教育政策会议记录。每一笔记录均对应一份已数字化为PDF格式的物理卷册,而后通过光学字符识别(OCR)技术提取全文文本,并辅以22项元数据字段(如标题、作者、出版年份、教育阶段、语言变体等)进行系统标注。最终数据以Parquet格式存储,确保零空值填充,缺失信息留空处理,从而忠实再现原始目录结构。
特点
该数据集最显著的特征在于其时间跨度与语言多样性,覆盖了近两个世纪希腊教育出版的完整谱系。语料库囊括καθαρεύουσα(纯正希腊语)、δημοτική(通俗希腊语)及古代希腊语、拉丁语、法语等共25种语言变体,深刻映射了希腊社会的双言现象与历史变迁。内容层面,全文文本占据总数据量的99.94%以上,平均每记录含28万字符,最大记录接近700万字符,为历时性语言演变、教育政策分析及OCR技术评估提供了丰沛的素材。此外,数据集的元数据完整性值得关注,尽管部分字段(如插图作者、批准年份)存在空白,但所有缺失均以空字符串而非空值表示,便于下游用户实施自定义过滤策略。
使用方法
LIBIEP数据集可直接通过Hugging Face Datasets库加载,适用于文本生成、掩码填充及特征提取等自然语言处理任务。用户可基于`collection`字段(`books`、`curricula`、`minutes`)筛选子集,或依据`year`字段进行时间维度的切片分析,例如聚焦1880年代至1980年代的出版高峰期。针对OCR噪声问题,研究者可运用`content`列的长度过滤(`len(content) > 60`)剔除提取失败的占位记录,并通过正则表达式处理内嵌HTML表格标记。数据集的22个字段均存储为字符串类型,建议在加载后按需转换`year`和`approval_year`为日期格式,同时注意`content`列末尾空行的清理。鉴于许可协议限制,该数据集仅限非商业学术研究用途。
背景与挑战
背景概述
LIBIEP数据集由希腊教育政策研究所(IEP)于2025年创建,汇聚了1808年至1998年间6,020卷希腊历史学校教科书、课程纲要及教育会议记录,涵盖Καθαρεύουσα、Δημοτική等多种希腊语变体及法语、德语等外语文本。该数据集旨在为计算语言学和数字人文研究提供结构化的历史教育文献资源,其构建依托欧盟区域发展基金与希腊国家资金支持,整合了33所机构(包括希腊议会图书馆、国家图书馆等)的数字化馆藏。作为首个大规模、带详元数据的希腊历史教科书语料库,LIBIEP为探究希腊教育史、语言演变及社会文化变迁提供了关键数据基础,并对OCR后处理、多语言自然语言处理及史学文本挖掘领域产生了重要推动作用。
当前挑战
该数据集所解决的领域核心挑战在于弥合历史多语言、多字体印刷文献的数字化鸿沟。具体包括:1)处理希腊语正字法过渡期(如πολυτονικό至μονοτονικό系统)带来的OCR噪声,尤其19世纪卡萨雷乌萨文本的磨损字体与复杂变音符号;2)应对元数据不完整问题(约88.6%的插画师字段缺失,53.4%的批准年份为空),需设计鲁棒的缺失值处理策略;3)消除PDF衍生的结构化伪影(如2,390条记录含HTML表格标签)与提取错误(16条记录仅存占位符文本);4)处理跨世纪的非均匀时间分布(1819-1828年数据空白)及混合排版惯例,以确保时序分析的有效性。
常用场景
经典使用场景
LIBIEP数据集汇聚了希腊教育政策研究所历史教科书收藏中的6020条记录,涵盖1808年至1998年间出版的学校教材、课程纲要与教育会议记录。其最经典的使用场景在于构建面向希腊历史书面语变体(如纯正希腊语、通俗希腊语及多种外语)的光学字符识别(OCR)后处理与文本校正系统。研究者可借助该数据集中丰富的OCR原始输出与多类型教材内容,训练能够处理19至20世纪复杂排版、多调正字法及表格结构的语言模型,从而显著提升对历史文档的自动转录与语义理解能力。
解决学术问题
该数据集有效解决了希腊教育史与语言史交叉研究中的若干关键学术问题。首先,它提供了跨越近两个世纪的数字化教材语料,使学者能够量化分析希腊教育政策的演变轨迹,包括课程内容、教学语言及意识形态的变迁。其次,数据集中包含的纯正希腊语与通俗希腊语文本,为探索现代希腊语从多调正字法向单调正字法的过渡提供了罕见的大规模实证资源。此外,通过OCR文本与元数据的结合,研究者得以系统评估历史文档数字化过程中的噪声特征,为数字人文学科中的文本质量标准化与数据清洗方法学奠定基础。
衍生相关工作
基于LIBIEP数据集已衍生出多项开创性工作。研究者利用其内容列开发了面向历史希腊语的上下文感知拼写校正算法,有效降低了OCR噪声对下游任务的影响。另有团队基于元数据字段(如语言变体、教育层次与批准年份)构建了希腊教材语体的历时演变分类器,揭示了20世纪语言政策对教科书写作风格的塑造作用。此外,该语料库还催生了针对教育文本的跨语言语义对齐研究,特别是将纯正希腊语教材与同时期欧洲外语教材进行对比分析,为比较教育史与历史语用学提供了可复现的数字化基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务