遇见数据集

danbooru-1024-eq-captioned

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

Danbooru 1024 e/q Captioned Dataset 是一个包含 59,495 张高分辨率(1024px)动漫风格图像的数据集,所有图像均来自 Danbooru 的 explicit (e) 和 questionable (q) 评级池。每张图像都附带通过 MiniMax-M3 模型生成的详细结构化 JSON 字幕。数据集结构包括原始图像目录(originals/)、字幕目录(captions/)、审查后的代理预览图像目录(proxies/)以及一个扁平化的元数据清单文件(danbooru-1024-eq-captioned.parquet),其中通过 proxy_path 字段提供审查后的预览图像,确保数据集查看器仅显示安全内容。统计信息显示:explicit 评级图像 19,367 张,questionable 评级图像 40,128 张,涉及 10,881 位不同艺术家,总大小约 29 GB。该数据集适用于文本到图像生成、动漫风格图像理解、多模态字幕生成等任务。图像版权归各自艺术家所有,字幕和元数据采用 CC-BY-SA-4.0 许可证。

The Danbooru 1024 e/q Captioned Dataset is a dataset containing 59,495 high-resolution (1024px) anime-style images, all sourced from the explicit (e) and questionable (q) rating pools of Danbooru. Each image is accompanied by a detailed structured JSON caption generated by the MiniMax-M3 model. The dataset structure includes a raw images directory (originals/), a captions directory (captions/), a censored proxy preview images directory (proxies/), and a flat metadata manifest file (danbooru-1024-eq-captioned.parquet), where the proxy_path field provides censored preview images to ensure the dataset viewer displays only safe content. Statistics show: 19,367 explicit-rated images, 40,128 questionable-rated images, involving 10,881 different artists, with a total size of approximately 29 GB. This dataset is suitable for tasks such as text-to-image generation, anime-style image understanding, and multimodal caption generation. Image copyrights belong to their respective artists; captions and metadata are licensed under CC-BY-SA-4.0.

创建时间:
2026-08-07
原始信息汇总

数据集概述

Danbooru 1024 e/q Captioned Dataset 是一个包含 59,495 张 高分辨率(1024px)动漫风格图像的数据集,图像来源于 Danbooru 的 explicit(明确)和 questionable(可疑)评分池。每张图像均配有通过 MiniMax-M3 生成的结构化 JSON 描述,涵盖逐角色着装状态清单、摄像笔记、情绪调色板及后处理检测等信息。

数据集构成

组件 说明
danbooru-1024-eq-captioned.parquet 统一的元数据清单,包含 22 列信息(艺术家、角色标签、来源作品、评分/收藏数、图像尺寸、token 使用量等),关联原始图像、代理图像和描述文件的路径
originals/ 原始未修改的 Danbooru 图像,以压缩 tar.gz 归档形式存储(每个归档约 200 个 webp/jpg 文件),用于下游微调训练
proxies/ 全局像素化的预览副本(JPEG 质量=40),仅供公开预览展示,不应用于训练
captions/ 每张图像对应的结构化 JSON 描述文件,总计 59,495 个

图像描述字段

字段 说明
rating 内容评级
medium 媒介类型
subject_and_action 详细场景描述
style_description 情绪、光照、镜头、色彩调色板
characters 逐角色对象(名称、描述、姿势、着装状态、可见身体部位、动作、目光、光照)
captured_text OCR 检测到的图像内文本
post_processing 检测到的后处理效果

数据统计

指标 数值
总图像数 59,495
Explicit 评级 19,367
Questionable 评级 40,128
分辨率 最长边 1024px
独立艺术家数 10,881
独立角色数 5,044
独立来源作品数 3,367
平均收藏数 117.1
平均评分 66.9

描述生成模型

使用 MiniMax-M3(通过 OpenRouter 调用),采用结构化 JSON 提示词,包含逐角色着装状态报告和可见解剖部位清单。

许可与版权

  • 图像版权归各自艺术家所有(原始发布于 Danbooru)
  • 数据集仅供个人研究和微调使用
  • 代理图像为衍生安全副本,不主张所有权
  • 语言:英语;许可证:cc-by-sa-4.0;标签:动漫、视觉、文生图、Danbooru、explicit、JSON 描述
搜集汇总
数据集介绍
danbooru-1024-eq-captioned 数据集图片
构建方式
该数据集源自Danbooru社区中评级为explicit与questionable的高分辨率动漫图像,精选59,495幅长边为1024像素的原始作品。构建流程严谨缜密,首先对图像进行系统性筛选与归档,以每批约200幅的规模压缩存储于tarball存档中,确保数据完整性与便捷访问。继而借助先进的MiniMax-M3模型,经由OpenRouter平台生成结构化JSON描述,逐一对每幅图像进行细致入微的标注,涵盖内容评级、媒介类型、场景动作、风格氛围、角色细目、可辨识文本及后期处理效果等多个维度。最终,整合为一份包含22个字段的Parquet元数据清单,将原始图像、审查预览与标注文件路径统一索引,形成高效便捷的数据检索体系。
特点
该数据集在动漫图像领域独树一帜,其特色在于深度细致的结构化标注范式。每幅图像对应的JSON描述不仅包含场景与动作的宏观勾勒,更深入到单个角色的着装状态、可见身体部位、姿态、视线方向乃至光照条件,辅以情绪调色板与摄影技法注释,为跨模态理解与生成任务提供了丰富的信息层次。数据集囊括10,881位艺术家、5,044个角色与3,367个原作来源,统计指标显示平均收藏数达117.1次、评分66.9分,充分体现了其内容的优质与多样性。此外,数据集中explicit与questionable评级的配比(19,367:40,128)及独有的审查预览版本设计,在保障内容安全的前提下,为研究敏感视觉内容的处理与过滤机制提供了珍贵的实验素材。
使用方法
使用者可依据清晰有序的目录结构灵活运用该数据集。原始图像解压自originals目录下的tar.gz归档文件,与captions目录中一一对应的JSON描述相辅相成,直接服务于文本到图像生成等下游模型的微调训练。对于需要快速浏览或构建数据预览的场景,proxies目录中经像素化处理的审查副本提供了安全便捷的展示选项,但明确不建议将其用于模型训练。Parquet元数据清单作为核心枢纽,通过统一索引路径,支持基于艺术家、角色、原作来源等条件的高效筛选与批量加载,极大便利了定制化数据子集的构建。研究者可结合自身需求,利用丰富的标注字段开展风格迁移、角色一致性生成、细粒度视觉理解等前沿课题的探索。
背景与挑战
背景概述
随着文本到图像生成技术的飞速发展,高质量、领域专属的数据集成为驱动模型性能跃升的关键要素。在此背景下,danbooru-1024-eq-captioned数据集应运而生,由研究团队于近期构建,旨在为动漫风格图像生成领域提供精细化的训练资源。该数据集精选自Danbooru社区的59,495张高分辨率(1024px)图像,涵盖明确与可疑评级内容,并采用MiniMax-M3模型生成结构化的JSON描述,包括人物着装状态、镜头参数、情绪色调及后期处理信息,极大丰富了图像的语义层次。其发布为动漫图像生成研究提供了宝贵的数据支撑,有望推动该领域在细粒度语义控制与内容多样性方面的进步。
当前挑战
该数据集所面临的挑战多重而严峻。首先,在领域层面,动漫图像生成需精准捕捉复杂的人物状态、情感氛围与艺术风格,而现有模型常因训练数据语义标注粗糙而难以生成符合预期的精细内容;该数据集通过结构化JSON描述,致力于缓解这一难题,但仍需处理文化背景差异与主观评价带来的标注歧义。其次,在构建过程中,数据集涉及敏感内容,需严格平衡隐私保护与数据可用性,其代理图像采用像素化处理以防泄露,但衍生数据可能引入视觉噪声;此外,从Danbooru社区获取图像的版权归属复杂,虽声明仅限研究用途,但法律合规与伦理审查仍是潜在风险,加之数据规模庞大,图像归档与元数据管理的工程实现亦构成技术挑战。
常用场景
经典使用场景
该数据集作为动漫风格图像生成与多模态理解研究的基石,其经典使用场景聚焦于高分辨率文本到图像(text-to-image)扩散模型的微调与评估。研究者利用其包含的59,495张1024像素动漫图像及结构化JSON描述,训练模型精确捕捉角色细节、服装状态、动作姿态与光影氛围,从而提升生成图像的艺术质量与语义一致性。同时,该数据集亦被用于视觉-语言预训练任务,通过图文对的联合建模,增强模型对动漫领域专有概念的语义理解与泛化能力,为后续零样本生成与风格迁移提供坚实的数据基础。
解决学术问题
该数据集有效缓解了动漫图像领域高质量标注数据稀缺的问题,其详尽的结构化标注体系为多模态学习提供了细粒度的监督信号,解决了传统数据集在角色状态描述、内容分级与后处理检测方面的不足。通过提供包含显式内容评级的清晰标注,它促进了安全可控的生成模型研究,使学术界能够系统探究敏感内容过滤与伦理对齐机制。此外,该数据集的规模与多样性支撑了关于长尾分布、艺术风格泛化及跨模态对齐等核心议题的实证分析,推动了动漫图像生成与理解技术的理论完善。
衍生相关工作
该数据集的发布催生了若干衍生工作,如基于其JSON标注构建的自动标签生成器,以及利用多模态大模型(如MiniMax-M3)进行图像描述蒸馏的技术路线。相关研究已探索将其与Stable Diffusion等开源模型结合,训练出动漫风格专属的微调版本,同时在文本-图像检索、跨模态推理等下游任务中验证了标注信息的有效性。此外,围绕数据集的分布特性,一些工作尝试开发内容分级分类器与隐私保护匿名化方法,为敏感视觉数据的合规使用提供了新思路,进一步拓展了该数据集在可信AI领域的影响边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务