遇见数据集

Turkish-Corpus

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

该数据集名为“SharePoint Kitap Metinleri”(SharePoint书籍文本),包含从SharePoint源文件夹中提取的TXT、PDF、DOCX文件转换而来的UTF-8编码的纯文本文件。数据集覆盖土耳其语和英语两种语言。处理流程包括:TXT文件自动检测编码并归一化为UTF-8;PDF文件先尝试提取嵌入文本,若文本内容不足则通过OCR补充;DOCX文件直接转换为纯文本。最终共生成2974个TXT文件。此外,数据集还提供了manifest.csv和manifest.jsonl文件记录每个源文件的转换状态,以及每个数据分片(part)的part_XX_books.csv文件,包含源文件路径、文本字节数、字符数、单词数、行数和SHA-256哈希值等元数据。该数据集适用于多语言文本处理、语言模型预训练、OCR后处理验证、文档数字化等任务。

The dataset named "SharePoint Kitap Metinleri" (SharePoint Book Texts) consists of UTF-8 encoded plain text files converted from TXT, PDF, and DOCX files extracted from a SharePoint source folder. The dataset covers Turkish and English languages. The processing pipeline includes: auto-detection and normalization of TXT files to UTF-8; for PDF files, first attempt to extract embedded text, supplement with OCR if insufficient; DOCX files directly converted to plain text. A total of 2974 TXT files were generated. Additionally, the dataset provides manifest.csv and manifest.jsonl files recording conversion status of each source file, and part_XX_books.csv files for each data shard, containing metadata such as source file path, byte count, character count, word count, line count, and SHA-256 hash. The dataset is suitable for multilingual text processing, language model pre-training, OCR post-processing verification, document digitization, etc.

创建时间:
2026-08-01
原始信息汇总

数据集概述

该数据集名为 SharePoint Kitap Metinleri,由 Ekrem-the-second 在 Hugging Face 上发布,其来源为 SharePoint 上的书籍文本资源。

语言

  • 土耳其语 (tr)
  • 英语 (en)

数据内容与格式

  • 数据源包括 TXT、PDF 和 DOCX 三种格式的文件。
  • 所有文件均被转换为 UTF-8 编码的 TXT 文本格式。
  • 其中:
    • TXT 文件:通过编码检测后规范化为 UTF-8。
    • PDF 文件:先提取内嵌文本,若页面文本不足则启用 OCR 识别。
    • DOCX 文件:转换为纯文本。
  • 总计包含 2974 个 TXT 文件

元数据文件

  • manifest.csvmanifest.jsonl:记录每个源文件的转换状态。
  • 每个数据分卷(part)附带 part_XX_books.csv 文件,其中包含:
    • 真实源文件路径
    • 文本字节数
    • 字符数
    • 单词数
    • 行数
    • SHA-256 哈希值

许可与发布说明

  • 数据集的许可证信息尚未自动确定。
  • 数据集创建者提醒:仅在拥有分享和重新发布权利的情况下,才可将这些内容上传至 Hub。
搜集汇总
数据集介绍
Turkish-Corpus 数据集图片
构建方式
在土耳其语自然语言处理资源相对匮乏的背景下,该数据集通过系统化管道将多格式文档统一转化为标准文本。构建过程针对TXT、PDF和DOCX三类源文件分别设计处理策略:TXT文件经编码探测后归一化为UTF-8;PDF文件优先抽取嵌入式文本,对文本量不足的页面辅以OCR识别;DOCX文件则直接转换为纯文本。最终生成2974个UTF-8编码的TXT文件,并配套manifest.csv与manifest.jsonl记录每个源文件的转换状态,同时为每个分片生成part_XX_books.csv,详尽登记源路径、字节数、字符数、词数、行数及SHA-256校验值,形成可追溯的构建链条。
特点
该数据集的核心特质在于其多语言覆盖与细粒度元数据记录的双重优势。语料涵盖土耳其语和英语,为跨语言研究提供了基础资源。所有文本均以UTF-8统一编码,消除了编码歧义带来的噪声。数据集不仅提供原始文本,还通过清单文件保留了每个文档的转换状态与统计指标,包括字节、字符、词和行的量化信息以及SHA-256哈希值,使得数据完整性验证与版本追踪成为可能。这种兼顾内容与溯源信息的结构,使数据集在语言模型训练与语料分析场景中均具备较高的实用价值。
使用方法
使用该数据集时,研究人员可通过manifest.csv或manifest.jsonl快速定位所需源文档的转换记录与状态信息,借助part_XX_books.csv获取各分片的量化统计与校验值,从而在加载文本前完成数据质量筛查。文本文件以UTF-8编码存储,可直接被主流自然语言处理框架读取,适用于语言模型预训练、微调或土耳其语与英语的跨语言迁移研究。鉴于许可证信息未自动确定,使用者在上传或再分发内容前须自行确认拥有相应的分享与再发布权利,以确保合规使用。
背景与挑战
背景概述
土耳其语作为一种形态复杂、黏着语特征显著的语言,其大规模高质量文本资源的匮乏长期制约着自然语言处理技术的纵深发展。Turkish-Corpus数据集的构建依托SharePoint平台,系统整合了TXT、PDF与DOCX等多源异构文档,经编码归一化、文本抽取及光学字符识别等流程,最终形成涵盖2974个UTF-8文本文件的双语语料库。该数据集聚焦于土耳其语及部分英语书籍文本的汇聚与结构化,由相关研究人员或机构基于实际文档资源整理发布,旨在为低资源语境下的语言建模、文本挖掘及跨语言迁移研究提供基础性数据支撑,对推动土耳其语信息检索与语义分析具有积极的奠基意义。
当前挑战
该数据集所应对的领域问题在于,土耳其语因其丰富的屈折与派生形态,导致传统词袋模型与统计方法面临严重的数据稀疏与词汇覆盖不足困境,而既有语料库多受限于领域单一或规模有限。在构建过程中,主要挑战体现为多格式文档的编码差异性显著,TXT文件需进行编码探测与UTF-8标准化,PDF文件在嵌入文本提取不足时须借助OCR技术补全,DOCX文件则须转换为规范纯文本;此外,源文档的版权状态未明确,数据共享与再发布权限存在法律不确定性,且跨语言文本的均衡性与质量一致性亦构成持续性的技术难题。
常用场景
经典使用场景
在自然语言处理领域,土耳其语作为一种粘着语,其丰富的形态变化对语料库的规模与质量提出了较高要求。Turkish-Corpus汇聚了从TXT、PDF及DOCX文档中提取的2974个UTF-8文本文件,并借助OCR技术弥补了扫描页面的文本缺失,从而为土耳其语的词汇统计、语言建模及词性标注等基础任务提供了可靠的语料支撑。其经典使用场景在于构建土耳其语的语言模型,例如训练n-gram或神经网络语言模型,以捕捉该语言的形态句法规律,同时亦可作为机器翻译系统的训练资源,促进土耳其语与英语之间的跨语言信息处理。
解决学术问题
土耳其语的自然语言处理研究长期受限于公开语料资源的匮乏,尤其是涵盖多领域、多体裁且经过标准化处理的文本集合较为稀缺。Turkish-Corpus通过系统性地转换与整合文档资源,在一定程度上缓解了数据稀缺问题,为学术研究提供了可复现的实验基础。该数据集使得研究者能够探究土耳其语的语素切分、句法分析以及语义角色标注等核心问题,并有助于检验多语言模型在低资源语言上的迁移学习效果。其意义在于推动了土耳其语计算语言学的实证研究,为语言资源的标准化建设提供了范例。
衍生相关工作
基于Turkish-Corpus的公开文本资源,后续研究衍生了一系列相关工作。部分学者利用该数据集微调多语言预训练模型,如BERTurk的变体,以提升土耳其语下游任务的性能。亦有研究将其作为基准语料,评估不同分词策略对土耳其语形态分析的影响,并在此基础上构建了词嵌入模型。此外,该数据集还激发了针对文档格式转换与OCR后处理的技术改进工作,为低资源语言语料库的自动化构建提供了可借鉴的流程。这些衍生工作共同拓展了土耳其语语言资源在学术与工程领域的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务