RyokoAI/CNNovel125K|文本生成数据集|小说数据集
收藏数据集概述
- 数据集名称: CNNovel125K
- 数据集大小: 约125,000部小说
- 语言: 简体中文
- 数据来源: 从中文小说托管网站http://ibiquw.com下载
- 主要用途: 用于无监督文本生成模型的训练
- 支持的任务:
- 文本分类
- 文本生成
数据集结构
数据实例
每个数据实例包含以下字段:
text
: 小说文本,包含所有章节meta
: 元数据subset
: 数据集标签,固定为cnnovel.ibiquw
id
: 小说IDq
: 质量分数,固定为0.9lang
: 语言标识,固定为zh_cn
title
: 小说标题author
: 小说作者
数据分割
数据未进行分割。
数据集创建
源数据
- 源语言生产者: 各小说的作者
注释
- 注释过程: 标题与小说文本和ID一同收集
- 注释者: 无人类注释者
使用数据集的考虑
- 社会影响: 旨在帮助训练生成“更娱乐”的中文内容的模型,也可能对其他语言模型有用
- 偏见讨论: 数据集内容反映各作者的偏见,需注意避免刻板印象
附加信息
-
数据集创建者: Ronsor Labs
-
许可信息: Apache 2.0
-
引用信息:
@misc{ryokoai2023-bigknow2022, title = {BigKnow2022: Bringing Language Models Up to Speed}, author = {Ronsor}, year = {2023}, howpublished = {url{https://github.com/RyokoAI/BigKnow2022}}, }

学生课堂行为数据集 (SCB-dataset3)
学生课堂行为数据集(SCB-dataset3)由成都东软学院创建,包含5686张图像和45578个标签,重点关注六种行为:举手、阅读、写作、使用手机、低头和趴桌。数据集覆盖从幼儿园到大学的不同场景,通过YOLOv5、YOLOv7和YOLOv8算法评估,平均精度达到80.3%。该数据集旨在为学生行为检测研究提供坚实基础,解决教育领域中学生行为数据集的缺乏问题。
arXiv 收录
中国空气质量数据集(2014-2020年)
数据集中的空气质量数据类型包括PM2.5, PM10, SO2, NO2, O3, CO, AQI,包含了2014-2020年全国360个城市的逐日空气质量监测数据。监测数据来自中国环境监测总站的全国城市空气质量实时发布平台,每日更新。数据集的原始文件为CSV的文本记录,通过空间化处理生产出Shape格式的空间数据。数据集包括CSV格式和Shape格式两数数据格式。
国家地球系统科学数据中心 收录
中国食物成分数据库
食物成分数据比较准确而详细地描述农作物、水产类、畜禽肉类等人类赖以生存的基本食物的品质和营养成分含量。它是一个重要的我国公共卫生数据和营养信息资源,是提供人类基本需求和基本社会保障的先决条件;也是一个国家制定相关法规标准、实施有关营养政策、开展食品贸易和进行营养健康教育的基础,兼具学术、经济、社会等多种价值。 本数据集收录了基于2002年食物成分表的1506条食物的31项营养成分(含胆固醇)数据,657条食物的18种氨基酸数据、441条食物的32种脂肪酸数据、130条食物的碘数据、114条食物的大豆异黄酮数据。
国家人口健康科学数据中心 收录
HazyDet
HazyDet是由解放军工程大学等机构创建的一个大规模数据集,专门用于雾霾场景下的无人机视角物体检测。该数据集包含383,000个真实世界实例,收集自自然雾霾环境和正常场景中人工添加的雾霾效果,以模拟恶劣天气条件。数据集的创建过程结合了深度估计和大气散射模型,确保了数据的真实性和多样性。HazyDet主要应用于无人机在恶劣天气条件下的物体检测,旨在提高无人机在复杂环境中的感知能力。
arXiv 收录
Fruits-360
一个高质量的水果图像数据集,包含多种水果的图像,如苹果、香蕉、樱桃等,总计42345张图片,分为训练集和验证集,共有64个水果类别。
github 收录