相关数据集
wanng/wukong100m
取自Noah-Wukong多语言多模态数据集中的中文部分,一共100M个图文对。大约占用16GB空间(仅仅是url等文本信息,不包含图片)。下载成功率在80%左右。
Hugging Face2022-12-11 更新930
wanng/laion-high-resolution-chinese
取自Laion5B-high-resolution多语言多模态数据集中的中文部分,一共2.66M个图文对。大约占用381MB空间(仅仅是url等文本信息,不包含图片)。
Hugging Face2022-12-14 更新440
wanng/example_mmdata_mnbvc
这是MNBVC多模态语料小组的图文通用语料的格式展示。数据集包含多个字段,用于描述文件的基本信息和内容,包括文件的MD5哈希值、唯一标识符、页码、块id、文本内容、图片数据、时间、数据类型、bounding box坐标和额外信息。数据集支持文本和图片两种数据类型,并提供了图片保存和读取的Python代码示例。
Hugging Face2023-11-14 更新210
wanng/wikipedia-zh-mnbvc
zhwiki-mnbvc数据集是MNBVC超大规模中文语料集的一部分,专注于中文维基百科的语料爬取和处理。数据时间范围为2023年2月至2023年5月,并且持续更新。数据集的处理流程参考了特定的清洗方法,并使用了组员开发的去重工具进行数据格式化。数据集的总行数为10,754,146,包含中文和英文内容,主要用于文本生成任务。
Hugging Face2023-05-29 更新790
wanng/midjourney-kaggle-clean
该数据集是对Kaggle上的Midjourney User Prompts & Generated Images数据集进行清理后的结果,共包含248,167对数据。数据集分为两个文件:ori.parquet(145,918对,midjourney的四格图)和upscaled.parquet(102,249对,使用了高清指令的图,这意味着这个图更受欢迎)。数据集包含多列信息,如内容、网址、代理网址、
Hugging Face2023-05-26 更新280



