遇见数据集

CyberHarem/pansy_pokemon

收藏
Hugging Face2024-01-16 更新2024-03-04 收录
官方服务:

资源简介:

这是一个关于宝可梦角色pansy的数据集,包含25张图像及其标签。该角色的核心标签包括`breasts, brown_hair, green_eyes, earrings, large_breasts, medium_breasts`,这些标签在数据集中已被修剪。图像从多个网站(如danbooru、pixiv、zerochan等)爬取,自动爬取系统由DeepGHS团队提供支持。数据集提供了多个版本,包括原始数据、不同尺寸的图像以及经过裁剪的图像。此外,还提供了如何使用Waifuc加载原始数据集的代码示例,并展示了标签聚类结果的列表。

This is a dataset focused on the Pokémon character Pansy, containing 25 images and their corresponding tags. The core tags for this character include `breasts, brown_hair, green_eyes, earrings, large_breasts, medium_breasts`, and these tags have been pruned in the dataset. The images were crawled from multiple platforms including Danbooru, Pixiv, Zerochan and other websites, with the automated crawling system powered by the DeepGHS team. The dataset offers multiple variants, including raw data, images in various resolutions and cropped images. Additionally, code examples for loading the raw dataset using Waifuc are provided, along with a list showcasing the results of tag clustering.

提供机构:
CyberHarem
原始信息汇总

数据集概述

数据集基本信息

  • 名称: Dataset of pansy (Pokémon)
  • 许可证: MIT
  • 任务类别: text-to-image
  • 标签: art, not-for-all-audiences
  • 大小类别: n<1K

数据集内容

  • 图像数量: 25张
  • 核心标签: breasts, brown_hair, green_eyes, earrings, large_breasts, medium_breasts

数据集包列表

名称 图像数量 大小 下载链接 类型 描述
raw 25 13.64 MiB Download Waifuc-Raw 原始数据,包含元信息(最小边对齐到1400像素,如果更大)。
800 25 10.27 MiB Download IMG+TXT 短边不超过800像素的数据集。
stage3-p480-800 52 18.46 MiB Download IMG+TXT 3阶段裁剪数据集,面积不小于480x480像素。
1200 25 12.82 MiB Download IMG+TXT 短边不超过1200像素的数据集。
stage3-p480-1200 52 22.27 MiB Download IMG+TXT 3阶段裁剪数据集,面积不小于480x480像素。

数据集加载

  • 加载工具: waifuc

  • 代码示例: python import os import zipfile from huggingface_hub import hf_hub_download from waifuc.source import LocalSource

    下载原始归档文件

    zip_file = hf_hub_download( repo_id=CyberHarem/pansy_pokemon, repo_type=dataset, filename=dataset-raw.zip, )

    提取文件到指定目录

    dataset_dir = dataset_dir os.makedirs(dataset_dir, exist_ok=True) with zipfile.ZipFile(zip_file, r) as zf: zf.extractall(dataset_dir)

    使用waifuc加载数据集

    source = LocalSource(dataset_dir) for item in source: print(item.image, item.meta[filename], item.meta[tags])

标签聚类结果

  • 示例:
    # Samples Img-1 Img-2 Img-3 Img-4 Img-5 Tags
    0 8 1girl, nipples, jewelry, open_mouth, pussy, smile, navel, blush, eyelashes, solo, uncensored, completely_nude, day, long_hair, looking_at_viewer, lying, outdoors, shiny_skin, spread_legs, tongue
搜集汇总
数据集介绍
CyberHarem/pansy_pokemon 数据集图片
构建方式
在动漫角色数据集构建领域,CyberHarem/pansy_pokemon 数据集聚焦于宝可梦系列中的角色 pansy。该数据集通过自动化爬虫系统从 Danbooru、Pixiv、Zerochan 等多个图像平台采集原始图像,并由 DeepGHS 团队提供技术支持。数据集共包含 25 张图像及其对应的标签信息,核心标签如 breasts、brown_hair、green_eyes 等已被精简处理。为适配不同应用场景,数据集提供了多种预处理版本:原始数据保留元信息并最小边对齐至 1400 像素;800 和 1200 版本限制较短边不超过相应像素;stage3-p480 系列则采用三阶段裁剪策略,确保图像区域不小于 480x480 像素,并生成更多样本。
特点
该数据集的核心特点在于其精细化的多版本设计和标签聚类功能。除了基础的原始图像与标签对,数据集还提供了基于 Waifuc 框架加载的原始压缩包,便于用户灵活使用。特别值得一提的是,数据集内置了标签聚类结果,通过可视化样本和标签表格,用户能够直观识别出角色常见的服饰、姿态或场景组合,例如在聚类中发现了完全裸露、散布腿部等特征。这种结构化聚类信息为下游任务如角色风格分析或图像生成提供了有价值的先验知识。
使用方法
使用该数据集时,用户可通过 Hugging Face Hub 直接下载不同版本的压缩文件。对于希望利用原始元数据的用户,推荐使用 Waifuc 库进行加载:首先通过 hf_hub_download 下载 dataset-raw.zip 并解压至本地目录,随后使用 LocalSource 类读取图像及其关联的标签和文件名信息。此外,用户也可以直接解压 IMG+TXT 格式的压缩包,获取对齐后的图像与文本标签,以适配常见的文本到图像生成或图像分类任务。
背景与挑战
背景概述
在文本到图像生成领域,高质量、细粒度的角色数据集是驱动模型精准理解与创作特定动漫形象的关键。CyberHarem/pansy_pokemon数据集由DeepGHS团队于近期构建,专注于宝可梦系列中角色“ pansy”的图像与标签收集。该数据集包含25张精心筛选的图像,并标注了如“breasts”、“brown_hair”等核心特征标签,旨在为动漫角色生成任务提供标准化训练素材。其影响力主要体现在为小样本角色生成研究提供了可复用的基准,推动了领域内对特定角色细节表征的探索。
当前挑战
该数据集面临的主要挑战包括:1) 领域问题层面,文本到图像生成模型在处理特定角色时,常因训练数据不足导致生成结果与角色原貌偏差较大,该数据集仅25张图像,难以覆盖角色的多姿态、多场景变化,限制了模型的泛化能力。2) 构建过程层面,图像自动爬取自Danbooru、Pixiv等多源站点,存在版权归属模糊、图像质量参差不齐的问题;同时,标签体系依赖自动标注与人工修剪,可能引入噪声或遗漏关键特征,如“completely_nude”等标签的敏感性也增加了数据集合规使用的复杂性。
常用场景
经典使用场景
在文本到图像生成领域,CyberHarem/pansy_pokemon数据集以其精细标注的动漫风格角色图像为核心,常用于训练和评估面向特定角色(如宝可梦中的pansy)的生成模型。该数据集包含25张高分辨率图像及其对应的标签(如breasts、brown_hair等),支持多种预处理版本(如800px、1200px及三级裁剪版),为研究者提供了灵活的基准测试平台。经典场景包括基于扩散模型(如Stable Diffusion)的微调训练,以学习角色一致性的视觉特征和语义对齐,从而生成符合指定标签组合的新图像。
解决学术问题
该数据集有效解决了动漫角色生成中数据稀缺与标签不精确的学术难题。通过提供多来源爬取的高质量图像与结构化标签(如核心属性裁剪),它支持了少样本学习研究,使模型能在极少量样本下捕捉角色专属视觉概念。此外,数据集促进了多模态对齐问题的探索,即如何将离散的文本标签(如'large_breasts')映射到连续的图像特征空间,从而提升生成图像的语义保真度。这一工作在动漫图像合成领域具有奠基性意义,推动了小样本生成与细粒度控制技术的发展。
衍生相关工作
该数据集衍生了一系列关键学术工作,尤其在角色一致性与标签解耦领域。例如,研究者基于此数据集开发了基于聚类(如tag clustering)的生成框架,通过挖掘图像集群中的共享标签(如'completely_nude'与'blush')实现更精细的风格迁移。此外,它启发了少样本动漫生成模型(如基于LoRA的微调方法)的评估基准,推动了DeepGHS团队在自动爬取与标注系统(waifuc)上的迭代优化。这些工作共同丰富了动漫生成领域的实验生态,为后续研究提供了可复现的数据与模型基线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务