相关数据集
RyokoAI_Syosetu711K
Syosetu711K 仓库提供了一个包含约 71.17 万部日语小说的文本数据集,这些小说来源于“成为小说家吧”网站。该数据集主要用于文本生成模型的非监督训练,同时也支持文本分类等任务。数据集中每部小说都带有元数据,包括作者、标题、ID、小说长度、积分、质量评分、章节数、关键词、是否为 R15+ 作品、小说类型 ID 和通用小说类型 ID 等信息,方便用户进行筛选和评估。该数据集基于 Apach
OpenCSG2024-07-19 更新210
binding_affinity
jglaser/binding_affinity 仓库提供蛋白质序列和配体SMILES的结合亲和力数据,共包含190万个独特的配对,适用于微调语言模型。数据来源于BindingDB、PDBbind-cn、BioLIP和BindingMOAD。该仓库提供预处理后的数据集,并支持用户手动进行预处理。用户可以加载预先分割的训练集和验证集,或者选择移除特定蛋白质序列的数据集。
OpenCSG2024-07-19 更新170
ShareGPT4Video
ShareGPT4Video Captions 4.8M数据集专注于视频的多模态字幕数据,旨在提升大型视频语言模型(LVLMs)和文本到视频模型(T2VMs)的模态对齐和细粒度视觉概念感知能力。数据集包含由GPT4-Vision生成的数据以及使用GPT4-Vision生成的视频-字幕对训练的ShareCaptioner-Video生成的数据,总规模达到480万。该数据集适用于视觉问答和问题回答等任
OpenCSG2024-07-19 更新180



