遇见数据集

steven-fei/webnovel-chinese

收藏
Hugging Face2026-03-28 更新2026-04-12 收录
官方服务:

资源简介:

--- license: apache-2.0 task_categories: - text-generation language: - zh tags: - llm - pretrain size_categories: - 1B<n<10B --- ## 简介 搜集网络上的网文小说,清洗,分割后,用于训练大语言模型,共计9000本左右,大约9B左右token。 ## 使用 ### 格式说明 采用`jsonl`格式存储,分为三个字段: - `title` :小说名称 - `chapter`:章节 - `text`:正文内容 示例: ```json {"title": "斗破苍穹", "chapter": " 第一章 陨落的天才", "text": "“斗之力,三段!”\n望着测验魔石碑上面闪亮得甚至有些刺眼的五个大字,少年面无表情,唇角有着一抹自嘲,紧握的手掌,因为大力,而导致略微尖锐的指甲深深的刺进了掌心之中,带来一阵阵钻心的疼痛……\n“萧炎,斗之力,三段!级别:低级!”测验魔石碑之旁,一位中年男子,看了一眼碑上所显示出来的信息,语气漠然的将之公布了出来……\n"} ```

提供机构:
steven-fei
搜集汇总
数据集介绍
steven-fei/webnovel-chinese 数据集图片
背景与挑战
背景概述
该数据集为中文网络小说预训练数据集,包含约9000本小说,经过清洗和分割,总token数约9B,格式为jsonl,每条数据包含小说标题、章节和正文内容,适用于大语言模型的文本生成任务。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务