AI大模型电子书训练数据集
收藏官方服务:
资源简介:
该数据集基于电子书OCR数据,涵盖学术著作、小说、期刊、教材等多类型扫描文本,经过版面分析与OCR识别,随后进行分段、去噪、纠错、标注和格式化处理的数字文本。该数据集应用于大语言模型预训练,通过引入该数据,大语言模型在长文本生成、阅读理解和专业问答任务上的准确率显著提升,语言风格更加规范,知识覆盖更全面。
提供机构:
杭州爻乾数字科技有限公司创建时间:
2026-08-04
搜集汇总
数据集介绍

背景与挑战
背景概述
该数据集源自电子书OCR扫描文本,广泛覆盖学术著作、小说、期刊和教材等类型,经过版面分析、识别、分段、去噪、纠错、标注和格式化等处理,形成高质量的数字语料。其设计用于大语言模型的预训练,能显著提升模型在长文本生成、阅读理解和专业问答任务上的准确率,同时使语言风格更规范、知识覆盖更全面。
以上内容由遇见数据集搜集并总结生成



