Turkish-Corpus
收藏资源简介:
该数据集名为“SharePoint Kitap Metinleri”(SharePoint书籍文本),包含从SharePoint源文件夹中提取的TXT、PDF、DOCX文件转换而来的UTF-8编码的纯文本文件。数据集覆盖土耳其语和英语两种语言。处理流程包括:TXT文件自动检测编码并归一化为UTF-8;PDF文件先尝试提取嵌入文本,若文本内容不足则通过OCR补充;DOCX文件直接转换为纯文本。最终共生成2974个TXT文件。此外,数据集还提供了manifest.csv和manifest.jsonl文件记录每个源文件的转换状态,以及每个数据分片(part)的part_XX_books.csv文件,包含源文件路径、文本字节数、字符数、单词数、行数和SHA-256哈希值等元数据。该数据集适用于多语言文本处理、语言模型预训练、OCR后处理验证、文档数字化等任务。
The dataset named "SharePoint Kitap Metinleri" (SharePoint Book Texts) consists of UTF-8 encoded plain text files converted from TXT, PDF, and DOCX files extracted from a SharePoint source folder. The dataset covers Turkish and English languages. The processing pipeline includes: auto-detection and normalization of TXT files to UTF-8; for PDF files, first attempt to extract embedded text, supplement with OCR if insufficient; DOCX files directly converted to plain text. A total of 2974 TXT files were generated. Additionally, the dataset provides manifest.csv and manifest.jsonl files recording conversion status of each source file, and part_XX_books.csv files for each data shard, containing metadata such as source file path, byte count, character count, word count, line count, and SHA-256 hash. The dataset is suitable for multilingual text processing, language model pre-training, OCR post-processing verification, document digitization, etc.
数据集概述
该数据集名为 SharePoint Kitap Metinleri,由 Ekrem-the-second 在 Hugging Face 上发布,其来源为 SharePoint 上的书籍文本资源。
语言
- 土耳其语 (
tr) - 英语 (
en)
数据内容与格式
- 数据源包括 TXT、PDF 和 DOCX 三种格式的文件。
- 所有文件均被转换为 UTF-8 编码的 TXT 文本格式。
- 其中:
- TXT 文件:通过编码检测后规范化为 UTF-8。
- PDF 文件:先提取内嵌文本,若页面文本不足则启用 OCR 识别。
- DOCX 文件:转换为纯文本。
- 总计包含 2974 个 TXT 文件。
元数据文件
manifest.csv和manifest.jsonl:记录每个源文件的转换状态。- 每个数据分卷(part)附带
part_XX_books.csv文件,其中包含:- 真实源文件路径
- 文本字节数
- 字符数
- 单词数
- 行数
- SHA-256 哈希值
许可与发布说明
- 数据集的许可证信息尚未自动确定。
- 数据集创建者提醒:仅在拥有分享和重新发布权利的情况下,才可将这些内容上传至 Hub。





