遇见数据集

CyberHarem/charlotte_honkai3

收藏
Hugging Face2024-01-17 更新2024-03-04 收录
官方服务:

资源简介:

这是一个名为Dataset of charlotte (Houkai 3rd)的数据集,包含158张图片及其标签。核心标签包括`pink_hair, hat, breasts, bangs, red_headwear, short_hair, beret, green_eyes, medium_breasts`。图片从多个网站(如danbooru, pixiv, zerochan等)爬取,爬取系统由DeepGHS团队开发。数据集提供了多个版本的下载链接,包括原始数据、不同分辨率的图片以及经过裁剪的图片。此外,还提供了如何使用waifuc加载原始数据集的代码示例。最后,README还列出了标签聚类的结果,展示了不同聚类的图片和标签。

这是一个名为Dataset of charlotte (Houkai 3rd)的数据集,包含158张图片及其标签。核心标签包括`pink_hair, hat, breasts, bangs, red_headwear, short_hair, beret, green_eyes, medium_breasts`。图片从多个网站(如danbooru, pixiv, zerochan等)爬取,爬取系统由DeepGHS团队开发。数据集提供了多个版本的下载链接,包括原始数据、不同分辨率的图片以及经过裁剪的图片。此外,还提供了如何使用waifuc加载原始数据集的代码示例。最后,README还列出了标签聚类的结果,展示了不同聚类的图片和标签。

提供机构:
CyberHarem
原始信息汇总

数据集概述

数据集基本信息

  • 名称: Dataset of charlotte (Houkai 3rd)
  • 许可证: MIT
  • 任务类别: text-to-image
  • 标签: art, not-for-all-audiences
  • 大小类别: n<1K

数据集内容

  • 图像数量: 158张
  • 核心标签: pink_hair, hat, breasts, bangs, red_headwear, short_hair, beret, green_eyes, medium_breasts

数据集包列表

名称 图像数量 大小 类型 描述
raw 158 321.54 MiB Waifuc-Raw 包含元信息的原始数据(如果较大,最小边对齐到1400)
800 158 150.66 MiB IMG+TXT 短边不超过800像素的数据集
stage3-p480-800 428 358.75 MiB IMG+TXT 3阶段裁剪数据集,区域不小于480x480像素
1200 158 270.48 MiB IMG+TXT 短边不超过1200像素的数据集
stage3-p480-1200 428 571.47 MiB IMG+TXT 3阶段裁剪数据集,区域不小于480x480像素

数据集加载

  • 加载工具: waifuc

  • 加载代码: python import os import zipfile from huggingface_hub import hf_hub_download from waifuc.source import LocalSource

    下载原始归档文件

    zip_file = hf_hub_download( repo_id=CyberHarem/charlotte_honkai3, repo_type=dataset, filename=dataset-raw.zip, )

    提取文件到指定目录

    dataset_dir = dataset_dir os.makedirs(dataset_dir, exist_ok=True) with zipfile.ZipFile(zip_file, r) as zf: zf.extractall(dataset_dir)

    使用waifuc加载数据集

    source = LocalSource(dataset_dir) for item in source: print(item.image, item.meta[filename], item.meta[tags])

标签聚类结果

  • 聚类列表:
    • 包含多个样本的图像及其相关标签,可能有助于挖掘某些服装。
搜集汇总
数据集介绍
构建方式
该数据集聚焦于《崩坏3》角色夏洛特,通过自动化爬取系统从Danbooru、Pixiv、Zerochan等多平台收集了158张图像及其标签。数据采集由DeepGHS团队开发的Waifuc框架驱动,确保了来源的多样性与效率。核心标签如粉发、帽子、贝雷帽等被精简处理,以突出角色辨识度。数据集提供多种预处理版本,包括原始元数据存档、短边限制为800或1200像素的图像文本对,以及三级裁剪后的480像素以上区域版本,总计428个样本,满足不同训练需求。
使用方法
数据集支持通过Waifuc框架直接加载原始存档,用户需从HuggingFace下载dataset-raw.zip文件并解压至本地目录,随后利用LocalSource接口迭代访问图像与标签元数据。对于训练需求,可选择800、1200或三级裁剪版本,其以ZIP格式提供图像文本对,便于集成至常见的文本到图像生成管线。建议根据模型分辨率选择合适的尺寸版本,以平衡细节保留与计算效率。
背景与挑战
背景概述
在生成式人工智能领域,文本到图像(text-to-image)模型的发展日新月异,其性能高度依赖于高质量、精细标注的数据集。针对特定虚拟角色(如游戏《崩坏3》中的角色“夏洛特”)的图像数据集,对于研究角色一致性生成、风格迁移以及细粒度视觉概念学习具有重要价值。该数据集由DeepGHS团队于近年来创建,核心研究问题聚焦于如何从互联网多源(如Danbooru、Pixiv、Zerochan等)自动爬取并构建一个包含158张图像及其详尽标签的角色专属数据集。该数据集通过自动标注与人工校验相结合的方式,提炼出“粉发、帽子、胸部、刘海、红色头饰、短发、贝雷帽、绿眼、中等胸部”等核心标签,并提供了多种分辨率版本(如800像素、1200像素)及三级裁剪版本,极大便利了后续的模型训练与评估。其影响力在于为角色定制化生成任务提供了标准化数据基础,推动了二次元文化领域内生成模型的精细化研究。
当前挑战
当前数据集面临的主要挑战包括:其一,领域问题层面,该数据集旨在解决特定虚拟角色的文本到图像生成任务,但角色在不同画师、不同姿势下的视觉多样性有限(仅158张图像),难以覆盖复杂场景下的生成需求,易导致模型过拟合或生成结果缺乏泛化性。其二,构建过程中,数据来源的多样性与版权合规性构成显著挑战,自动爬取系统虽高效,但需应对图像质量参差不齐、标签噪声(如部分图像包含成人内容)以及多源数据格式不一致等问题。此外,数据集的标签体系依赖于自动标注与人工修正,但核心标签的选取可能遗漏角色的关键特征(如特定服饰、表情),且标签间的语义关联(如“帽子”与“贝雷帽”)未充分建模,限制了模型对角色概念的深层次理解。
常用场景
经典使用场景
在二次元角色驱动的内容生成领域,CyberHarem/charlotte_honkai3数据集常被用于文本到图像(text-to-image)生成模型的微调与评估。该数据集聚焦于《崩坏3》角色夏洛特,收录了158张高质量图像及其精细标注的标签,涵盖角色外观特征如粉色长发、贝雷帽、绿色眼眸等核心视觉元素。研究者可借助此数据集训练模型精准捕捉特定角色的视觉风格与细节,实现从文本描述到角色肖像的高 fidelity 映射,为动漫风格的角色生成任务提供标准化的训练素材。
解决学术问题
该数据集有效解决了动漫角色个性化生成中数据稀缺与标注不一致的学术难题。通过跨平台采集(如Danbooru、Pixiv)并统一标签体系,它为标准化的角色特征学习提供了可靠基准,助力研究者探索少样本学习(few-shot learning)与风格迁移(style transfer)在二次元图像生成中的应用。其意义在于推动了可控生成(controllable generation)技术的发展,使模型能够从混杂的视觉数据中分离出角色身份与背景属性,为后续的角色一致性生成研究奠定了数据基础。
实际应用
实际应用中,该数据集可赋能游戏开发、虚拟偶像运营与同人创作等场景。例如,开发者可利用微调后的生成模型快速产出夏洛特在不同服装、姿势或背景下的概念图,加速角色衍生内容的迭代;虚拟主播团队可基于此数据集训练模型实时生成符合角色设定的直播素材,提升观众互动体验。此外,该数据集还支持自动化图像标注与检索系统,帮助内容平台高效管理海量动漫图像资源。
数据集最近研究
最新研究方向
当前,以《崩坏3》角色“夏洛特”为代表的二次元角色图像数据集,正成为文本到图像生成领域细粒度人物概念学习的重要基石。该数据集通过自动化爬虫技术从Danbooru、Pixiv等社区采集高质量同人图像,并辅以结构化标签(如发型、服饰、表情)与多分辨率裁剪版本,为扩散模型在特定角色风格迁移、姿态生成及局部特征可控编辑方面提供了标准化训练资源。伴随AIGC在虚拟偶像与同人创作中的爆发式应用,此类数据集不仅支撑了角色一致性生成的前沿探索,更推动了跨模态理解与个性化内容生产技术的落地,其精细的标签聚类分析亦为挖掘角色多模态属性关联提供了新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务