FareedKhan/1k_stories_100_genre|故事生成数据集|类型分类数据集
收藏数据集文档
概述
该数据集包含1000个故事,跨越100个不同类型。每个故事以数据框的表格格式表示。数据集包括唯一ID、标题和每个故事的内容。
类型列表
所有类型的列表可以在genres.txt文件中找到。
python with open(story_genres.pkl, rb) as f: story_genres = pickle.load(f)
类型列表示例:
python genres = [Sci-Fi, Comedy, ...]
数据框格式
数据集的结构如下:
- id: 每个数据框的唯一标识符。
- title: 故事的标题。
- story: 故事的内容。
- genre: 故事的类型。
示例数据框
id | title | story | genre |
---|---|---|---|
25235 | The Unseen Miracle | It was a stormy night in ... | Horror |
... | ... | ... | ... |
平均字数长度
- 标题:6个单词
- 故事:960个单词
许可证
该数据集在cc-by-2.0许可证下发布。
中国裁判文书网
中国裁判文书网是中国最高人民法院设立的官方网站,旨在公开各级法院的裁判文书。该数据集包含了大量的法律文书,如判决书、裁定书、调解书等,涵盖了民事、刑事、行政、知识产权等多个法律领域。
wenshu.court.gov.cn 收录
HazyDet
HazyDet是由解放军工程大学等机构创建的一个大规模数据集,专门用于雾霾场景下的无人机视角物体检测。该数据集包含383,000个真实世界实例,收集自自然雾霾环境和正常场景中人工添加的雾霾效果,以模拟恶劣天气条件。数据集的创建过程结合了深度估计和大气散射模型,确保了数据的真实性和多样性。HazyDet主要应用于无人机在恶劣天气条件下的物体检测,旨在提高无人机在复杂环境中的感知能力。
arXiv 收录
Figshare
Figshare是一个在线数据共享平台,允许研究人员上传和共享各种类型的研究成果,包括数据集、论文、图像、视频等。它旨在促进科学研究的开放性和可重复性。
figshare.com 收录
UniMed
UniMed是一个大规模、开源的多模态医学数据集,包含超过530万张图像-文本对,涵盖六种不同的医学成像模态:X射线、CT、MRI、超声、病理学和眼底。该数据集通过利用大型语言模型(LLMs)将特定模态的分类数据集转换为图像-文本格式,并结合现有的医学领域的图像-文本数据,以促进可扩展的视觉语言模型(VLM)预训练。
github 收录
云浮市失信被执行人名单信息
该数据包含了2022年至今云浮市失信被执行人名单信息,指云浮市政务服务数据管理局对该信息的变动情况进行跟踪、采集、预测、分析、公布等活动。
开放广东 收录