RyokoAI/ScribbleHub17K
收藏资源简介:
ScribbleHub17K数据集包含来自Scribble Hub网站的超过373,000章节的文本,涵盖了大约17,500个系列。该数据集主要用于无监督的文本生成模型训练,但也可能用于其他目的。每个数据实例包括章节文本和元数据,如系列ID、章节ID、质量评分、标题、作者、章节数、评分、评分次数、类型和标签。数据集未进行分割,且包含NSFW内容,未经过滤。数据集反映了作者的偏见,使用时需注意。
ScribbleHub17K数据集包含来自Scribble Hub网站的超过373,000章节的文本,涵盖了大约17,500个系列。该数据集主要用于无监督的文本生成模型训练,但也可能用于其他目的。每个数据实例包括章节文本和元数据,如系列ID、章节ID、质量评分、标题、作者、章节数、评分、评分次数、类型和标签。数据集未进行分割,且包含NSFW内容,未经过滤。数据集反映了作者的偏见,使用时需注意。
数据集概述
名称: ScribbleHub17K
描述: ScribbleHub17K 是一个包含超过373,000章节、约17,500个系列的数据集,源自原始故事分享网站 Scribble Hub。
语言: 英语
许可: Apache-2.0
主要用途: 主要用于无监督文本生成模型的训练,也可用于其他文本相关任务。
数据集结构
数据实例
每个数据实例包含以下字段:
- text: 章节文本内容
- meta: 元数据,包括:
subset: 数据源标签,固定为scribblehubseries: 系列IDid: 章节IDlang: 语言,始终为en(英语)q: 质量评分,范围从0.0到1.0title: 章节和系列标题chapters: 系列中的章节总数rating: Scribble Hub评分,范围0到5星rating_ct: 评分次数author: 作者名genre: 系列流派列表tags: 系列标签列表
Q-Score分布
质量评分(Q-Score)分布如下:
0.00: 0 0.10: 0 0.20: 0 0.30: 84 0.40: 718 0.50: 3775 0.60: 22300 0.70: 72581 0.80: 137982 0.90: 135800 1.00: 59
数据集创建
来源数据
- 语言生产者: 各小说的作者
- 注释过程: 使用脚本自动解析标题、评分等元数据
使用考虑
- 社会影响: 旨在帮助训练生成“更娱乐”的内容的模型
- 偏见讨论: 数据集内容反映作者的偏见,包含未过滤的NSFW材料
附加信息
- 数据集维护者: Ronsor Labs
- 许可证: Apache 2.0
- 引用信息:
@misc{ryokoai2023-bigknow2022, title = {BigKnow2022: Bringing Language Models Up to Speed}, author = {Ronsor}, year = {2023}, howpublished = {url{https://github.com/RyokoAI/BigKnow2022}}, }




