遇见数据集

king-image-stickmann

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

KING2 Stickman数据集是一个包含10,085张简笔画或骨架图图像及其英文描述的数据集,专为训练名为KING2-IMAGE的SDXL LoRA模型而设计。数据集由两部分组成:主要部分包含10,000张图像,源自HumanML3D运动捕捉数据的合成骨架渲染,适用于研究用途;次要部分包含85张图像,是从Wikimedia Commons收集并经过许可验证的真实手绘或矢量简笔画插图,遵循CC0、公共领域、CC BY或CC BY-SA等许可证。所有图像均处理为1024x1024像素的RGB PNG格式,每张图像都配有描述性文本:主要部分的描述基于HumanML3D官方运动描述改写为简笔画语境,次要部分的描述则源自Wikimedia Commons标题。数据集适用于文本到图像生成任务,特别是简笔画风格图像的生成。数据以图像文件与对应文本描述文件对的形式组织,并提供一个综合的metadata.jsonl文件,包含文件名、描述、标签、来源、质量评分(仅主要部分)以及许可证信息等字段。已知限制包括:主要部分的图像具有单一视觉风格(白色背景上的粗线条骨架,无头部圆圈、颜色、背景或物体),且每张图像通常只包含一个角色(源自单人运动数据)。

The KING2 Stickman dataset consists of 10,085 stick figure/skeleton image and English description pairs, specifically built for training the KING2-IMAGE SDXL LoRA model. It is divided into two parts with different origins and licenses. The main part contains 10,000 images synthetically rendered from HumanML3D motion capture data, intended for research use. The minor part includes 85 images collected from Wikimedia Commons, featuring verified real hand-drawn or vector stick figure illustrations under licenses such as CC0, public domain, CC BY, or CC BY-SA, with details available in the accompanying ATTRIBUTION.md file. All images are processed into a uniform 1024x1024 pixel RGB PNG format. Each image is paired with descriptive text: descriptions for the main part are adapted from HumanML3D official motion descriptions to a stick figure context, while those for the minor part are derived from their Wikimedia Commons titles. The dataset is suitable for text-to-image generation tasks, particularly for generating stick figure-style images. Data is organized as file pairs (image files with corresponding text description files) and includes a comprehensive metadata.jsonl file containing fields such as filename, description, tags, source, quality score (main part only), and source-specific information like license details. Known limitations include: the main part images have a uniform visual style (thick-line skeletons on white backgrounds without head circles, colors, backgrounds, or objects), and each image typically features only one character (derived from single-person motion data).

创建时间:
2026-07-10
原始信息汇总

数据集概览:KING2 Stickman Dataset

该数据集包含 10,085 张火柴人图像及对应的英文描述,专为训练 KING2-IMAGE SDXL LoRA(模型 RASHID778/king2-image,适配器 stickman)而构建。

数据规模与许可

数据集分为两部分,许可协议不同

图像范围 数量 来源 许可
images/000000.png009999.png 10,000 HumanML3D 动作捕捉渲染(合成骨架) 研究用途(见下方说明)
images_commons/010000.png010084.png 85 来自维基共享资源的真实插画 每张图像许可不同(CC0/PD/CC BY/CC BY-SA),详见 ATTRIBUTION.md

注意:维基共享资源部分存储在独立的 images_commons/captions_commons/ 目录中,不在 images/ 目录内。

数据来源

来源 贡献
Deepthought42424/humanml3d_stick_figures_5_frames 29,228 个动作序列(扫描 832,864 帧)——主要图像来源
hassanjbara/humanml3d_stick_figures 21 个序列(同一语料的子集,按 sample_id 去重)
HumanML3D texts 官方动作描述,用作描述(按 sample_id 索引)
维基共享资源 85 张真实手绘/矢量火柴人插画,已逐张核实许可(详见 ATTRIBUTION.md

数据处理流程(图像 000000–009999)

  1. 帧选择:对每个动作序列,在 30%/50%/70% 位置解码 3 个候选帧,保留动作中期得分最高的姿势(每序列 1 张图像,最大化姿势多样性)。
  2. 质量评分(1–10分):基于墨水比例、对比度(标准差)、人物边界框覆盖度和边缘裁剪的启发式评分,仅保留 得分 ≥ 8 的图像。
  3. 去重:通过 256 位 dHash 与 32 位 LSH(汉明距离 ≤ 12)进行精确和近似去重,去除了 5,936 张近似重复图像(保留 23,292 张唯一图像)。
  4. 标准化:所有图像转换为 1024×1024,RGB,PNG 格式(源帧为 512×512 正方形渲染,使用 LANCZOS 放大——对于线条画实际上无损)。
  5. 描述生成:将每个动作的官方 HumanML3D 文本改写为火柴人描述(例如 "a person is taking a picture" → "a stickman is taking a picture, simple black and white stick figure line drawing"),并附加动作标签。
  6. 最终筛选:按质量得分保留前 10,000 张图像。

维基共享资源补充(图像 010000–010084)

为补充真实手绘/矢量火柴人艺术,对维基共享资源进行了搜索(类别 Stick figures + 全文搜索 "stickman"/"stick figure"/"Strichfigur"),并通过 Commons API 检查每张候选图像的许可元数据。仅保留标记为公有领域、CC0、CC BY 或 CC BY-SA(且无 "trademarked"/其他限制标志)的文件。随后手动筛选实际相关的内容(排除类似古陶器上的“执棍少年”、博物馆手杖文物、真实危险标志摄影等误匹配项)和安全主题。每张保留的图像均标准化为 1024×1024 RGB PNG(保持宽高比调整大小,在白色画布上居中,与数据集其余部分一致),并使用其 Commons 标题生成描述。

每张图像的完整归属信息(作者、许可、来源链接)位于 ATTRIBUTION.md——重用前必须阅读,因为 CC BY / CC BY-SA 要求在重新分发时进行署名和相同方式共享。

数据集结构

dataset/ ├── images/ 10,000 × 1024×1024 RGB PNG (000000.png … 009999.png) — HumanML3D ├── captions/ 每个图像对应一个 .txt 描述文件(相同文件名) ├── images_commons/ 85 × 1024×1024 RGB PNG (010000.png … 010084.png) — 维基共享资源 ├── captions_commons/ 每个图像对应一个 .txt 描述文件(相同文件名) ├── metadata.jsonl 包含所有 10,085 行的 file_name, caption, tags, source 及来源特定字段 ├── ATTRIBUTION.md images_commons/* 中每张图像的作者/许可/来源信息 └── README.md

metadata.jsonl 示例

HumanML3D 来源(000000–009999): json {"file_name": "images/000000.png", "caption": "a stickman walking in a strong manner, simple black and white stick figure line drawing", "tags": ["stickman", "stick figure", "pose", "line drawing", "minimal", "black and white", "walking"], "quality_score": 10, "source": "humanml3d_stick_figures_5_frames", "sample_id": "...", "frame_index": 12}

维基共享资源补充(010000–010084): json {"file_name": "images_commons/010000.png", "caption": "a stickman illustration, simple black and white stick figure line drawing", "tags": ["stickman", "stick figure", "wikimedia-commons", "real-illustration"], "source": "wikimedia_commons", "commons_title": "File:HD@DH.nrw Strichfigur 1.svg", "commons_url": "https://commons.wikimedia.org/wiki/File:HD@DH.nrw_Strichfigur_1.svg", "license": "CC BY 4.0", "license_url": "...", "artist": "HD@DH.nrw | Michelle Dahlmanns"}

已知局限性

  • 单一视觉风格(000000–009999):所有 HumanML3D 来源的图像均为白色背景上的粗笔触骨架渲染——无头部圆形、无颜色、无背景、无物体。85 张 Commons 补充图像部分解决了此问题,但相对主语料库样本量较小。
  • 单一人体(000000–009999):HumanML3D 动作均为单人场景,无多人场景(Commons 补充中的少数图像显示多人)。
  • 许可混合——使用前请阅读
    • images/000000.png009999.png:HumanML3D 源自 AMASS/HumanAct12,它们具有学术/研究许可。上游 HF 数据集未声明明确许可。对于此范围,请视为研究用途;在商业部署前请审阅许可协议。
    • images/010000.png010084.png:每张图像的许可分别为公有领域、CC0、CC BY 或 CC BY-SA——请查看 ATTRIBUTION.md 以了解每张文件的确切许可和所需的署名。CC BY-SA 文件对衍生数据集的重新分发施加了相同方式共享义务(但不影响基于其训练的模型权重)。
搜集汇总
数据集介绍
king-image-stickmann 数据集图片
构建方式
KING2 Stickman数据集容纳了10,085幅火柴人图像,其构建过程严谨而富有层次。主体部分源自HumanML3D运动捕捉数据,通过智能帧选择策略,从每一运动序列中提取最具代表性的中间姿态,并辅以质量评分系统,仅保留得分不低于8的高质量图像。借助256位dHash与LSH算法进行精确及近似去重,剔除了近六千幅重复样本,最终精选出万幅标准化为1024×1024像素的RGB图像。同时,数据集融入了85幅源自维基共享资源的真实手绘或矢量插画,这些作品经由API许可证校验及人工筛选,确保了版权的合规性,由此形成了兼具合成与真实元素的独特图像集合。
特点
该数据集最为显著的特点在于其混合性的结构与高度的标准化。主体部分在视觉风格上高度统一,呈现为黑色粗线条在白色背景上的骨架式描绘,无头部圆形、无色彩及背景干扰,营造出极简的艺术质感。而来自维基共享的附加部分则弥补了风格单一的局限,引入了多样化的真实手绘风格,为数据增添了丰富性。每幅图像均配备有经过特殊改写、从人物动作描述转化为火柴人语境的英文标题,以及便于分类与检索的动作标签,使得数据集在专注火柴人姿态领域的同时,具备了从研究到创作的多重应用潜力。
使用方法
使用该数据集时,其组织架构为快速开发提供了便利。图像与对应的字幕文本按编号分别存放于`images/`与`captions/`目录,维基共享部分则独立置于`images_commons/`与`captions_commons/`。所有10,085条记录的元数据集中存储于`metadata.jsonl`文件,囊括文件名、标题、标签及来源等关键信息,便于程序化加载与分析。用户可借助此数据集,直接用于训练文本到图像的生成模型,如已有的SDXL LoRA模型,或进行姿态识别、风格化生成等下游任务。需特别留意的是,数据集包含混合许可证,主部适用于研究用途,而维基共享部分则需严格遵循`ATTRIBUTION.md`中每幅图像的个别署名与许可要求。
背景与挑战
背景概述
KING2 Stickman数据集诞生于2024年,由研究团队精心构建,旨在为文本到图像生成模型提供高质量的火柴人图像训练资源。该数据集汇聚了来自HumanML3D动作捕捉数据的合成渲染图像(10,000张)以及维基共享资源的真实手绘插图(85张),总计10,085张图像。核心研究问题在于填补大规模、高多样性火柴人姿态数据集的空白,以支持SDXL等模型在简化人体动作表达上的精细化生成能力。通过系统化的跨平台搜索(Hugging Face、Kaggle、GitHub),确认其在公开领域内无同等规模与可用许可的替代品,彰显了其在特定视觉任务中的独特地位,对于推动人体姿态相关生成技术的研究具有奠基性影响。
当前挑战
该数据集所解决的领域问题聚焦于火柴人图像生成中的动作多样性匮乏与风格单一性瓶颈。在构建过程中,首要挑战来自数据稀缺性:尽管历经广泛搜索,仍无现成的大规模高分火柴人数据集,迫使团队从动作捕捉渲染中自主生成,并面临大量低质量候选帧需筛选。其次,风格统一性困境显著:10,000张合成图像均为白色背景上的粗线条骨架,缺乏头部、色彩及背景元素,尽管85张真实插图部分缓解,却仍难企及风格多样化。此外,许可混合问题构成法律挑战:合成图像源自研究许可的HumanML3D/AMASS数据,商业复用前需审慎;而真实插图则分属CC0、CC BY或CC BY-SA等不同许可,需按图逐一溯源并满足归属和共享要求,增加了分发合规性成本。
常用场景
经典使用场景
KING2 Stickman数据集在文本到图像生成领域具有经典应用,尤其适用于训练扩散模型以生成简笔画风格的人物姿态图像。该数据集包含10,085张精心筛选的简笔画图片,其中10,000张来自HumanML3D动作捕捉数据的骨骼渲染,85张来自维基共享资源的真实手绘或矢量插图。每张图片均配有英文描述,如“a stickman is walking, simple black and white stick figure line drawing”,使得模型能够学习从文本描述到简笔画姿态的映射。该数据集特别适合用于微调Stable Diffusion XL等模型,通过LoRA技术实现高效训练,生成具有高质量和多样性的简笔画图像。
衍生相关工作
该数据集衍生出多个相关经典工作,其中最直接的是基于其训练的KING2-IMAGE SDXL LoRA模型,该模型利用数据集中的10,000张简笔画图像进行微调,实现了从文本描述到高质量简笔画图像的生成。此外,该数据集的构建流程和方法论为后续研究提供了参考,如动作捕捉数据到简笔画图像的转换策略、基于感知哈希的近重复图像去重算法以及质量评分标准。这些工作进一步推动了简笔画生成领域的发展,并启发了其他研究人员在人体姿态表示、图像生成和数据增强等方向上的探索。数据集本身也被用作基准,评估不同文本到图像模型在简化姿态表示上的生成能力。
数据集最近研究
最新研究方向
KING2 Stickman Dataset的构建标志着简约线条画数据集领域的一项重要突破,它聚焦于人体姿态与动作的抽象视觉表达,为文本到图像生成模型(如SDXL LoRA)提供了大规模、高质量的骨架姿态训练素材。该数据集巧妙融合了从HumanML3D运动捕捉数据中经筛选与标准化处理的合成骨架渲染图,以及来自维基共享资源的真实手绘线条画,弥补了同类资源在规模与许可合规性上的空白。其创新的质量评分、去重与标题改写流程,使得数据在保持姿态多样性的同时兼具语义准确性,为研究视觉语言模型在极简风格下的动作理解与生成能力奠定了坚实基础。尤其在LoRA微调与个性化图像合成领域,该数据集有望推动对抽象视觉元素(如火柴人)的语义对齐与高效生成研究,对增强人工智能在儿童教育、快速原型设计及辅助沟通工具中的表现力具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务