遇见数据集

CyberHarem/type97_girlsfrontline

收藏
Hugging Face2024-01-13 更新2024-03-04 收录
官方服务:

资源简介:

这是type97/97式/97式 (Girls Frontline)的数据集,包含258张图片及其标签。图片从多个网站(如danbooru, pixiv, zerochan等)爬取,爬取系统由DeepGHS团队提供。数据集的核心标签包括长头发、胸部、刘海、棕色头发、双马尾、丝带、头发丝带、棕色眼睛、眼睛间的头发、非常长的头发、黑色头发、红色丝带、中等胸部、黄色眼睛等。数据集提供了不同尺寸和裁剪方式的图片包,如raw、800、stage3-p480-800、1200、stage3-p480-1200等。此外,还提供了使用waifuc加载原始数据集的代码示例,并展示了标签聚类结果的列表。

这是type97/97式/97式 (Girls Frontline)的数据集,包含258张图片及其标签。图片从多个网站(如danbooru, pixiv, zerochan等)爬取,爬取系统由DeepGHS团队提供。数据集的核心标签包括长头发、胸部、刘海、棕色头发、双马尾、丝带、头发丝带、棕色眼睛、眼睛间的头发、非常长的头发、黑色头发、红色丝带、中等胸部、黄色眼睛等。数据集提供了不同尺寸和裁剪方式的图片包,如raw、800、stage3-p480-800、1200、stage3-p480-1200等。此外,还提供了使用waifuc加载原始数据集的代码示例,并展示了标签聚类结果的列表。

提供机构:
CyberHarem
原始信息汇总

数据集概述

基本信息

  • 名称: type97/97式/97式 (Girls Frontline)
  • 包含内容: 258张图像及其标签
  • 核心标签: long_hair, breasts, bangs, brown_hair, twintails, ribbon, hair_ribbon, brown_eyes, hair_between_eyes, very_long_hair, black_hair, red_ribbon, medium_breasts, yellow_eyes
  • 许可证: MIT
  • 任务类别: text-to-image
  • 标签: art, not-for-all-audiences
  • 大小类别: n<1K

数据集包详情

包名 图像数量 大小 类型 描述
raw 258 372.47 MiB Waifuc-Raw 包含元信息的原始数据,最小边对齐至1400像素(如果更大)。
800 258 195.46 MiB IMG+TXT 短边不超过800像素的数据集。
stage3-p480-800 653 433.78 MiB IMG+TXT 三阶段裁剪数据集,区域不小于480x480像素。
1200 258 323.81 MiB IMG+TXT 短边不超过1200像素的数据集。
stage3-p480-1200 653 629.99 MiB IMG+TXT 三阶段裁剪数据集,区域不小于480x480像素。

数据集加载

  • 加载工具: waifuc

  • 加载代码示例: python import os import zipfile

    from huggingface_hub import hf_hub_download from waifuc.source import LocalSource

    下载原始档案文件

    zip_file = hf_hub_download( repo_id=CyberHarem/type97_girlsfrontline, repo_type=dataset, filename=dataset-raw.zip, )

    提取文件至目录

    dataset_dir = dataset_dir os.makedirs(dataset_dir, exist_ok=True) with zipfile.ZipFile(zip_file, r) as zf: zf.extractall(dataset_dir)

    使用waifuc加载数据集

    source = LocalSource(dataset_dir) for item in source: print(item.image, item.meta[filename], item.meta[tags])

标签聚类结果

  • 示例:
    • 集群0: 55个样本,包含标签如1girl, looking_at_viewer, china_dress, red_dress等。
    • 集群1: 17个样本,包含标签如1girl, black_gloves, red_necktie, holding_gun等。
    • 集群2: 8个样本,包含标签如1girl, cat_ears, vest, hair_bell等。
    • 集群3: 5个样本,包含标签如1girl, bare_shoulders, collarbone, black_bikini等。
搜集汇总
数据集介绍
CyberHarem/type97_girlsfrontline 数据集图片
构建方式
在二次元角色图像数据集构建领域,针对《少女前线》中的97式角色,CyberHarem团队精心打造了此数据集。其构建过程融合了自动化爬取与人工精修,数据源涵盖Danbooru、Pixiv、Zerochan等知名图站,依托DeepGHS团队研发的智能采集系统完成图像与标签的原始收集。随后,对核心角色标签如长发、双马尾、棕色眼睛等进行筛选与精简,确保标签集精炼且具有代表性。最终形成了包含258张图像及其对应标签的标准化数据集,并提供了多种分辨率与裁剪策略的打包版本,以满足不同应用场景的需求。
特点
该数据集最显著的特点在于其多维度的版本设计与丰富的元信息。除了提供原始未处理的高清图像外,还特别推出了短边不超过800或1200像素的标准化版本,以及经过三阶段智能裁剪、确保有效区域不小于480x480像素的增强版本。数据集内嵌了详尽的标签聚类结果,通过可视化示例与结构化表格,直观展示了不同服装、姿态(如旗袍、校服、泳装)的分布模式。此外,每个版本均附带了图像与对应文本标签文件,为文本到图像生成等任务提供了对齐的监督信号。
使用方法
使用该数据集时,研究者可通过Hugging Face Hub直接下载各版本压缩包。对于追求原始元数据的用户,推荐采用Waifuc框架加载原始版本,通过简单的Python代码即可实现图像、文件名及标签的迭代访问。若需快速训练,可直接解压800或1200像素的IMG+TXT版本,其内图像与标签文件一一对应,便于直接构建数据加载器。三阶段裁剪版本则适用于需要关注局部细节的生成任务,其多视角的裁剪结果能有效增强模型对角色特征的鲁棒性。
背景与挑战
背景概述
在二次元文化蓬勃发展的当下,角色图像数据集成为推动文生图模型进步的关键资源。由DeepGHS团队于近期创建的CyberHarem/type97_girlsfrontline数据集,聚焦于游戏《少女前线》中的人气角色97式,收录了258张经过精细标注的图像。该数据集的核心研究问题在于如何为特定虚拟角色构建高质量、多姿态、多服饰变体的图像集合,以支持文本到图像生成模型的微调与评估。通过从Danbooru、Pixiv等平台自动爬取并清洗数据,该数据集不仅提供了原始图像,还附带了丰富的标签信息,为角色一致性生成研究奠定了坚实基础,对二次元领域AI创作工具的发展产生了显著影响。
当前挑战
该数据集所面临的挑战首先体现在领域问题上:文生图模型需要从有限样本中精准捕捉角色核心特征(如发型、服饰、表情),并能在不同风格与场景下保持身份一致性,这对数据集的多样性与标注精度提出了极高要求。其次,在构建过程中,自动爬取系统虽高效,但面临数据源质量参差不齐、图像分辨率不一、标签冗余或缺失等难题;同时,从海量网络图像中筛选出目标角色的有效样本,并剔除低质量或重复内容,需要复杂的过滤与聚类算法。此外,数据集规模仅数百张,如何在小样本条件下平衡过拟合与泛化能力,也是后续模型训练中的关键挑战。
常用场景
经典使用场景
该数据集围绕《少女前线》中的人气角色“97式”构建,收录了258张来自Danbooru、Pixiv、Zerochan等知名插画社区的高质量图像,并附有详尽的标签注释。在文本到图像生成领域,这一资源为基于扩散模型的角色定制化生成提供了精准的视觉样本与语义锚点。研究者可借助其标签体系训练模型,学习角色标志性元素(如双马尾、棕色长发、红色发带)与多种服装变体(旗袍、校服、泳装)之间的映射关系,从而实现对特定动漫角色在多样化场景下的可控生成。
衍生相关工作
该数据集衍生出的代表性工作包括:基于Waifuc框架的动漫图像自动爬取与预处理管线,其多阶段裁剪策略(如stage3-p480-800)被后续多个角色数据集沿用;标签聚类分析技术,通过将图像按服装与姿态分组,催生了面向“官方换装”与“同人再创作”的细粒度风格分类研究。此外,该数据集的构建模式启发了CyberHarem社区中一系列同类角色数据集的标准化发布,促进了文本到图像生成领域内“角色身份保持”这一子方向的基准测试与模型竞赛。
数据集最近研究
最新研究方向
当前,基于游戏《少女前线》中角色97式的图像数据集正成为文本到图像生成领域的前沿研究热点。该数据集包含258张经过精细标注的图像,覆盖多种官方衍生服装与姿态,如旗袍、校服、泳装等,并通过聚类分析揭示了不同视觉风格下的标签分布规律。这一资源为少样本条件下的角色一致性与风格迁移研究提供了高质量的训练素材,尤其在动漫角色定制化生成、多模态检索与可控图像合成等方向展现出重要价值。随着AIGC技术在二次元内容创作中的广泛应用,该数据集的发布不仅推动了领域内对角色特征保持与多样性平衡的探索,也为后续基于扩散模型的人物图像生成研究奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务