遇见数据集

tarih-ders-kitaplari-1931

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

该数据集提供了1931年土耳其官方高中历史教科书《Tarih I: Tarihtenevelki Zamanlar ve Eski Zamanlar》(史前时代和古代)和《Tarih II: Ortazamanlar》(中世纪)的完整机器可读文本。这两卷书由土耳其历史学会(Türk Tarihi Tetkik Cemiyeti)编写,经教育部(Maarif Vekâleti)命令出版,于1931年至1941年间在土耳其高中使用。数据集包含多个版本:'sayfalar'配置包含两卷所有页面的原始OCR文本(未校正);'dogrulanmis'配置包含两个已经人工校正的章节(“Beşer Tarihine Giriş”和“İslam Tarihi”,共129页),校正结果与原始扫描件进行了比对;'parcalar'配置将文本分割为适合检索增强生成(RAG)的片段,每个片段带有页面范围标记;'inceleme'配置包含基于这些文本的比较研究主张,每个记录包含精确引用、来源页面、置信度等级(确定/强/中/弱)以及机器验证的引用存在性。数据集规模在1千到1万条记录之间,语言为土耳其语,采用CC0-1.0许可协议,原始作品属于公共领域。该数据集适用于历史文本分析、OCR质量评估、土耳其语自然语言处理、文本生成和检索等任务。

This dataset provides the complete machine-readable text of the official Turkish high school history textbooks "Tarih I: Tarihtenevelki Zamanlar ve Eski Zamanlar" (Prehistoric and Ancient Times) and "Tarih II: Ortazamanlar" (Middle Ages) published in 1931. It includes multiple configurations: sayfalar contains raw OCR text of all pages (uncorrected); dogrulanmis contains two manually corrected chapters ("Beşer Tarihine Giriş" and "İslam Tarihi", 129 pages) validated against original scans; parcalar splits text into segments suitable for Retrieval-Augmented Generation (RAG), each with page range markers; inceleme contains comparative research claims based on these texts, with precise citations, source pages, confidence levels (Certain/Strong/Medium/Weak), and machine-verified citation existence. The dataset size ranges from 1,000 to 10,000 records, language is Turkish, licensed under CC0-1.0, with original works in the public domain. It is suitable for historical text analysis, OCR quality evaluation, Turkish natural language processing, text generation, and retrieval tasks.

创建时间:
2026-08-16
原始信息汇总

数据集概述:Tarih I ve Tarih II (1931) — 机器可读全文

数据集简介

本数据集收录了由土耳其历史研究学会(Türk Tarihi Tetkik Cemiyeti)编写、经教育部(Maarif Vekâleti)命令出版,于1931年至1941年间在土耳其高中作为官方历史教科书使用的《Tarih I》(史前时代与古代时代)和《Tarih II》(中世纪)两卷本的完整文本。每一印刷页均为独立记录,包含永久标识符、现成的引文信息和在原始扫描件中的精确位置,可追溯至具体印刷页。

数据集结构(Configs)

配置名称 内容 文本质量
sayfalar 两卷全部内容,按页组织 未校正的OCR
dogrulanmis 两个章节,共129页 人工校正 — 已与扫描件比对
parcalar RAG分块,附页范围引用信息 未校正的OCR
inceleme 基于文本的比较研究的论点
inceleme-metin 同一研究的全文,分章节(土耳其语+英语)

书籍信息

  • Tarih I:史前时代与古代时代 — 伊斯坦布尔,1931年,教育部出版,共印刷30,000册。来源扫描:https://kutuphane.ttk.gov.tr/resource?itemId=267298&dkymId=6415
  • Tarih II:中世纪 — 伊斯坦布尔,1931年,教育部出版,共印刷25,000册。来源扫描:https://kutuphane.ttk.gov.tr/resource?itemId=267295&dkymId=6416

已校正确认章节

  • 人类历史导论(BEŞER TARİHİNE GİRİŞ) — Tarih I,印刷页1-24,共24页,6,122词
  • 伊斯兰历史(İSLAM TARİHİ) — Tarih II,印刷页79-184,共105页,28,240词

原始OCR文本存储于text_ocr字段,每次校正均可查验;校正后的记录标记为text_source=corrected

研究分析(İnceleme)

  • inceleme配置包含对上述章节的比较研究论点,每条记录包含直接引文、印刷页、证据强度(确定/强/中/弱)及来源页地址;verified字段表示引文是否经机器验证在该页逐字存在。
  • 记录类型包括:quotation(A1…,书中逐字引用的段落,即被验证对象)、verse(K1…,研究所依据的经文)、finding(B1…,结合引文与经文得出的结论,并记录其所依据的引文和经文)、claim(C1…,概括书中明确表述的条目)。
  • inceleme-metin配置提供该研究的完整文本,按章节、语言(土耳其语/英语)、DOI及来源页地址组织,弥补了单独阅读论点时缺少论证和方法说明的不足。

许可与权利

  • 原始作品为公有领域(https://rightsstatements.org/vocab/NoC-OKLR/1.0/)
  • 衍生数据与代码:CC0-1.0
  • 扫描件来源:土耳其共和国土耳其历史学会图书馆,索书号 A/4789

引用与发布渠道

  • 推荐引用DOI(代表所有版本并始终解析至最新版):https://doi.org/10.5281/zenodo.21956339
  • inceleme配置中的研究为独立出版物,拥有独立DOI:https://doi.org/10.5281/zenodo.21963507
  • 官方网站:https://asayimusa19.github.io/tarih-ders-kitaplari-1931
  • 代码仓库(处理流程与校正):https://github.com/asayimusa19/tarih-ders-kitaplari-1931
  • 其他渠道:Internet Archive、Vikikaynak、Wikidata等平台均提供相关资源链接。

注意事项

引用时建议优先使用dogrulanmis配置;语料库其余部分为150 DPI扫描提取的未经人工校正的OCR输出,1931年拼写和奥斯曼土耳其语词汇会提高错误率。

搜集汇总
数据集介绍
tarih-ders-kitaplari-1931 数据集图片
构建方式
该数据集收录了1931年由土耳其历史研究学会编纂、教育部刊行的《历史I》与《历史II》两部官方高中历史教科书全本,以页为基本单位构建,每页记录包含永久标识、完整书目信息及原始扫描件中的精确坐标,确保可溯源至实体书页。数据集的加工经由OCR技术从150 DPI扫描件中提取文本,并依据内容组织为多种配置:未经核校的完整文本、经人工比对扫描件逐字修正的高精度章节、适用于检索增强生成(RAG)的段落切分及标注页码范围、以及基于文本的分析评述数据,后者涵盖每条论断所依据的引文、来源页码、置信强度及机器核验标志。此外,评述全文亦按章节提供土耳其语与英语版本。
使用方法
使用者可通过HuggingFace数据集的多种配置依需取用:欲获取两卷全书的原始文本,可选择'sayfalar'配置;若需高精度文本用于引证或细读,应优先选用'dogrulanmis'配置,其中包含人工修订的'BEŞER TARİHİNE GİRİŞ'与'İSLAM TARİHİ'两章节;针对检索增强生成(RAG)或段落级分析,'parcalar'配置提供了带页码标签的切分文本;对于旨在探索文本诠释的研究者,'inceleme'配置提供与原文精确对应的论断数据,而'inceleme-metin'则呈现完整的评述文章。所有数据均以JSONL格式存储,兼容主流数据分析工具,便于结合自然语言处理或计量史学方法进行深度挖掘。
背景与挑战
背景概述
本数据集由土耳其历史研究学会(Türk Tarihi Tetkik Cemiyeti)于1931年编纂,经教育部指令出版,并在1931至1941年间作为土耳其高中官方历史教科书使用。该数据集通过数字化手段,将《Tarih I》与《Tarih II》两卷共百余页的扫描文本转化为机器可读格式,并附有详细的页码、出处及引用信息,为历史学、教育学及自然语言处理等领域提供了珍贵的一手史料。其核心研究问题在于系统性地呈现土耳其共和国早期历史教育的官方叙事,同时通过OCR技术与人工校正相结合的方式,提升历史文献的可获取性与研究价值。该数据集不仅为学界提供了高质量的历史文本资源,还通过开源许可与多平台发布(如Zenodo、Internet Archive),促进了跨学科合作与土耳其近代史研究的数字化进程。
当前挑战
该数据集面临的挑战主要源自历史文献数字化的固有难题。一方面,原始文本采用1931年土耳其语拼写并包含大量奥斯曼土耳其语词汇,这使得未经修正的OCR识别错误率较高,尤其对依赖精准文本的历史研究构成障碍。为此,数据集特别提供了人工校对的'dogrulanmis'子集,但该子集仅覆盖全书部分章节(129页),其余内容仍需研究者审慎使用。另一方面,构建过程中的挑战在于平衡开放获取与质量控制:尽管项目公开了全部OCR输出,但非专家用户可能难以辨识文本的可靠性,从而影响数据集的整体可用性。此外,由于两卷本分别来自不同扫描源,图像质量差异也增加了统一处理的难度,进而影响后续文本对齐与引用追踪的准确性。
常用场景
经典使用场景
该数据集收录了1931年土耳其共和国早期历史教科书《Tarih I》与《Tarih II》的全文,涵盖从史前时代至中世纪的宏大叙事,为历史学、教育学及语言学领域提供了珍贵的一手文献。其经典使用场景在于构建机器可读的土耳其语历史文本语料库,支持文本生成、信息检索及自然语言处理任务。研究者可基于此数据集开展历史话语分析,探究早期共和意识形态如何通过教育文本塑造民族认同;亦可利用其精细的页面级标注进行OCR后处理研究,以提升对1930年代土耳其语及奥斯曼语词汇的识别准确性。
解决学术问题
该数据集有效解决了历史学界长期面临的早期土耳其共和国教育文献数字化程度低、获取困难的问题,为量化分析与大规模文本挖掘提供了规范化的数据基础。其多配置设计——包括未修正OCR、人工校对文本和RAG分块——使得研究者能够针对性地研究OCR错误模式、历史文本的语言特征,以及教科书内容在意识形态传播中的具体作用。通过将每项论证与印刷页码精准关联,数据集还促进了可验证的学术引用实践,显著增强了人文计算研究的可重复性与严谨性。
实际应用
在实际应用中,该数据集可作为数字人文项目、历史教育研究以及文化遗产数字化工作的核心数据源。图书馆与档案馆可利用其页面级元数据优化馆藏检索系统;教育研究者可藉此分析1930年代课程设计理念与教学内容的演变;同时,该语料库还可服务于土耳其语语言模型的预训练与微调,尤其在处理历史文本变体及阿拉伯-拉丁字母转写任务中具有独特价值。其开放授权(CC0)亦使其成为开发多语种历史档案平台与知识图谱的理想基础资源。
数据集最近研究
最新研究方向
该数据集通过对1931年土耳其共和国早期官方历史教科书《Tarih I》与《Tarih II》进行机器可读化处理,为数字人文学科中的历史文本分析、话语研究以及教育史研究提供了珍贵的原始材料。其前沿研究方向聚焦于利用自然语言处理技术对未校正的OCR文本进行自动纠错与语义标注,结合人工校对的‘dogrulanmis’配置,构建高精度历史语料库。同时,该数据集内置的‘inceleme’与‘inceleme-metin’配置,将文本内部主张与《古兰经》经文及实证依据相链接,开创了基于证据的文本批评研究方法,为追踪土耳其民族主义史学叙事演变、探究奥斯曼帝国至共和国时期意识形态转型提供了量化与质性相结合的分析路径,对理解现代中东历史书写具有重要学术意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务