遇见数据集

booru-essence-2026-tars

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

Booru Essence 2026是一个衍生自Lodestones/booru-essence的数据集,专为图像字幕和文本到图像生成任务而设计。该数据集包含41,598个样本,来自Danbooru和e621两个平台,混合了多种内容。所有样本以47个tar分片(train-000000.tar至train-000047.tar)的形式提供,每个分片约1.5 GB(最后一个分片略小)。每个样本由三个文件组成:一个图像文件(jpg/png/webp格式),一个JSON格式的元数据文件(包含md5哈希、来源、评级、字幕桶、标签、字幕、触发词、图像宽度、图像高度、收藏数等字段),以及一个纯文本字幕文件(与JSON中的caption字段相同,但以单独文件提供)。评级分为general、sensitive、questionable和explicit,且标签和字幕均以“Drawn by <艺术家>”格式开头,注明艺术家归属。数据集采用CC-BY-NC-SA-4.0许可证,并标注为“not-for-all-audiences”,可能包含不适合所有观众的内容。

Booru Essence 2026 is a dataset derived from Lodestones/booru-essence, designed for image captioning and text-to-image generation tasks. It contains 41,598 samples from Danbooru and e621 platforms, mixed with various content. All samples are provided as 47 tar shards (train-000000.tar to train-000047.tar), each about 1.5 GB (the last shard slightly smaller). Each sample consists of three files: an image file (jpg/png/webp), a JSON metadata file (containing fields such as md5 hash, source, rating, caption bucket, tags, caption, trigger word, image width, image height, favorites count, etc.), and a plain text caption file (same as the caption field in JSON but provided as a separate file). Ratings are divided into general, sensitive, questionable, and explicit. Tags and captions start with "Drawn by <artist>" format, attributing the artist. The dataset is licensed under CC-BY-NC-SA-4.0 and labeled as not-for-all-audiences, potentially containing content not suitable for all viewers.

创建时间:
2026-08-30
原始信息汇总

Booru Essence 2026 — tar shards 数据集概述

基本信息

  • 许可协议:cc-by-nc-sa-4.0(知识共享-非商业使用-相同方式共享 4.0)
  • 数据规模:10K < n < 100K,具体包含 41,598 个样本
  • 内容标签:不适宜所有受众(NSFW)、Danbooru、e621、Furry、图像描述、文生图等领域相关

数据集来源与衍生

该数据集是 RicemanT/booru-essence-2026 数据集的 tar 压缩分片版本,后者包含元数据、查看器和 CSV 文件。本数据集源自 Lodestones/booru-essence,所有艺术作品版权归各自艺术家所有(来自 Danbooru / e621 平台)。

数据布局与格式

  • 47 个分片文件train-000000.tartrain-000047.tar),每个约 1.5 GB(最后一片除外)
  • 每个样本由 三个文件 组成,以 md5 哈希值作为唯一键:
    1. 图片文件<md5>.<ext>)— 格式包括 jpg、png、webp
    2. 元数据文件<md5>.json)— 包含 md5、来源、分级、描述桶、标签、描述文本、触发标签、图片宽高、收藏数
    3. 描述文本文件<md5>.txt)— 与元数据中的描述内容相同

数据内容特点

  • 来源混合:同时包含 Danbooru 与 e621 两个平台的样本
  • 分级信息:每个样本的 sourcerating(general / sensitive / questionable / explicit)可在 json 文件中查看
  • 描述格式tagscaption 均以 Drawn by <artist> 的艺术家署名格式开头
  • 关联映射:元数据仓库中的 shard 列记录了每一行数据与其所属 tar 分片的对应关系
搜集汇总
数据集介绍
booru-essence-2026-tars 数据集图片
构建方式
该数据集以Booru社区图像资源为基底,整合了Danbooru与e621两大图库的视觉-文本对,采用分片打包策略将四万余条样本组织为47个tar归档。每条样本以md5值为唯一键,同时存储图像文件、结构化JSON元数据及纯文本标注,形成图像、属性与描述的三元组结构。元数据保留来源、评级、标签、标注桶、触发标签及收藏计数等原始字段,并通过独立的CSV索引建立分片映射关系,便于按行定位与子集抽取。
特点
数据集覆盖常规、敏感、存疑与露骨四类内容分级,融合拟人化与非拟人化艺术风格,具备较高的视觉与语义多样性。所有标注均以艺术家署名开篇,形成统一的“Drawn by <artist>”前缀格式,有利于模型学习细粒度作者归属与风格关联。样本总量逾四万,规模适中而结构规整,图像格式兼容jpg、png与webp,配合分片存储与元数据索引,兼顾了存储效率与检索便利性。
使用方法
使用者可依据元数据仓库中的分片映射表定位目标样本所在的tar文件,下载后解压获取图像与对应JSON和TXT文件。JSON中的caption字段与TXT内容一致,可直接用于图像描述生成或文本到图像的条件训练;tags字段支持多标签分类与检索任务,rating与source字段则可用于内容过滤或条件控制。结合触发标签与艺术家前缀,该数据集亦适用于定制化风格微调与可控生成研究。
背景与挑战
背景概述
在图像生成与跨模态理解技术迅猛演进的背景下,大规模、高质量、多来源的图文配对数据成为推动模型能力跃迁的关键支柱。booru-essence-2026-tars数据集于2026年发布,由研究者RicemanT构建,衍生自Lodestones/booru-essence,整合了Danbooru与e621两大知名图像社区的逾四万一千个独特样本,以tar分片形式封装图像、元数据与自然语言描述。该数据集聚焦于图像标注与文本到图像生成任务,尤其关注成人向与拟人化内容的长尾分布,为细粒度语义对齐与风格多样性建模提供了宝贵的资源,对开放域生成模型的鲁棒性与伦理边界研究具有重要参考价值。
当前挑战
该数据集所应对的核心领域问题在于复杂图文场景下的细粒度标注与生成一致性,即如何从社区驱动的标签体系中提炼出可泛化的语义表示。构建过程中面临多重挑战:其一,数据来源涵盖Danbooru与e621,二者在标签规范、内容分级与社区文化上存在显著差异,统一元数据与描述格式需谨慎协调;其二,样本涉及敏感与露骨内容,如何在不失语义完整性的前提下进行合规化处理与风险标注,考验着数据治理策略;其三,艺术家署名与版权信息的嵌入要求在图像、json与文本之间保持严格一致,任何字段错位都可能引发溯源困难与伦理争议;其四,分片存储与md5键值映射机制需确保十万级样本在分发与加载过程中的完整性与可复现性。
常用场景
经典使用场景
在图像-文本多模态学习领域,Booru Essence 2026-tars数据集凭借其精细的标签体系与高质量的图文配对,成为图像描述生成与文本到图像合成任务的经典基准。该数据集汇聚了来自Danbooru与e621两大图库的逾四万样本,每一样本均包含图像、元数据及描述文本,其标签粒度涵盖角色、风格、构图等维度,为模型训练提供了丰富的监督信号。研究者常以此数据集评估生成模型对复杂视觉概念的理解与复现能力,尤其是在处理特定艺术风格与亚文化视觉元素时,其价值尤为凸显。
衍生相关工作
以Booru Essence 2026-tars为基础,学界与开源社区衍生出一系列经典工作。例如,基于该数据集微调的扩散模型在动漫图像生成任务中取得了显著提升,推动了风格化生成技术的发展。此外,相关研究还探索了利用其元数据进行条件生成与属性编辑的方法,如通过艺术家标签实现风格迁移。该数据集亦催生了针对低资源场景的迁移学习策略,以及面向内容安全的多模态过滤模型,进一步拓展了其学术与工程影响力。
数据集最近研究
最新研究方向
在跨模态图像生成与细粒度视觉理解领域,面向二次元与兽迷亚文化圈层的图像-文本数据集逐渐成为突破主流模型风格偏差的关键资源。booru-essence-2026-tars 以 tar 分片形式整合了来自 Danbooru 与 e621 的逾四万组样本,每例均附有包含艺术家署名、分级标签与自然语言描述的结构化元数据,为条件图像合成与多模态对齐研究提供了兼具规模与语义深度的素材。当前研究前沿聚焦于利用此类带有来源与分级信息的细粒度标注,探索生成模型对敏感内容、艺术风格及创作者归属的可控建模,并借此缓解通用数据集在非主流视觉文化上的表征失衡。该数据集亦推动了以艺术家标识为锚点的归因生成与伦理评估方法发展,对构建可追溯、尊重原创的生成式AI生态具有实证意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务