遇见数据集

AI大模型电子书训练数据集

收藏
杭州数据交易所2026-08-04 更新2026-06-18 收录
官方服务:

资源简介:

该数据集基于电子书OCR数据,涵盖学术著作、小说、期刊、教材等多类型扫描文本,经过版面分析与OCR识别,随后进行分段、去噪、纠错、标注和格式化处理的数字文本。该数据集应用于大语言模型预训练,通过引入该数据,大语言模型在长文本生成、阅读理解和专业问答任务上的准确率显著提升,语言风格更加规范,知识覆盖更全面。

创建时间:
2026-08-04
搜集汇总
数据集介绍
AI大模型电子书训练数据集 数据集图片
背景与挑战
背景概述
该数据集源自电子书OCR扫描文本,广泛覆盖学术著作、小说、期刊和教材等类型,经过版面分析、识别、分段、去噪、纠错、标注和格式化等处理,形成高质量的数字语料。其设计用于大语言模型的预训练,能显著提升模型在长文本生成、阅读理解和专业问答任务上的准确率,同时使语言风格更规范、知识覆盖更全面。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务