genai-image-tag-db-mit
收藏资源简介:
该数据集名为'genai-image-tag-db (MIT build)',是一个用于图像生成的标签数据库,特别适用于stable-diffusion及相关技术。数据集包含来自danbooru、e621和derpibooru等多个来源的标签,并以SQLite和Parquet格式提供。数据集基于CC0基础的SQLite数据库,并添加了MIT许可的增量内容。Parquet格式特别包含danbooru标签,列包括tag_id、tag、format_name、type_name、count、deprecated_tags以及特定语言的标签(日语和中文)。数据集采用MIT许可,并包含来自多个来源的贡献,每个来源都有自己的MIT许可。数据集还包括数据清理的说明,确保语言特定标签包含适当的脚本。
This dataset, named 'genai-image-tag-db (MIT build)', is a tag database for image generation, specifically optimized for Stable Diffusion and related technologies. It collects tags from multiple sources including Danbooru, e621, Derpibooru and other platforms, and is distributed in both SQLite and Parquet formats. The dataset is built upon a CC0-licensed base SQLite database, with additional incremental content released under the MIT License. The Parquet-format release exclusively contains Danbooru tags, with columns including tag_id, tag, format_name, type_name, count, deprecated_tags, as well as language-specific tags for Japanese and Chinese. The entire dataset is licensed under the MIT License, and incorporates contributions from multiple sources, each of which is also licensed under the MIT License. Additionally, the dataset includes data cleaning guidelines to ensure that language-specific tags utilize appropriate character scripts.
数据集概述
基本信息
- 数据集名称: genai-image-tag-db (MIT build)
- 托管地址: https://huggingface.co/datasets/NEXTAltair/genai-image-tag-db-mit
- 许可证: MIT
- 语言: 英语 (en)、日语 (ja)
- 任务类别: 文本检索 (text-retrieval)
- 标签: tag-database, image-generation, stable-diffusion, lora, booru, danbooru, e621, derpibooru
内容描述
该存储库包含标签数据库的 MIT 构建版本。它通过获取 CC0 基础 SQLite 数据库 (genai-image-tag-db-cc0.sqlite) 并在其上应用 MIT 许可的源增量 而生成。
文件结构
genai-image-tag-db-mit.sqlite: 完整的 SQLite 数据库(关系型模式)。parquet_danbooru/: 为 Hugging Face 数据集查看器导出的 Parquet 文件(目前仅包含 danbooru 数据)。source_effects.tsv: 来源影响报告(记录实际更改了数据库的源)。skipped_sources.tsv: 被过滤或跳过的源。db_health/: 数据库完整性检查(外键、孤立项、重复项等)。
数据模式
SQLite 模式说明
此构建使用与 CC0 基础版本相同的关系模式,并在 TAG_STATUS 表中新增了以下列:
deprecated(布尔型): 弃用标志(与别名重定向分开)。deprecated_at(日期时间型,可为空): 被弃用的时间(未知则为 NULL)。source_created_at(日期时间型,可为空): 源端时间戳(如果可用)。
Parquet 模式 (danbooru 拆分)
列包括:
tag_id(整数型)tag(字符串型)format_name(字符串型)type_name(字符串型)count(整数型)deprecated_tags(字符串列表) — 已弃用/别名标签的反向列表(对应TAGS.tag)。lang_ja(字符串列表)lang_zh(字符串列表)
许可证与来源
分发许可证
- 此 MIT 构建 版本依据 MIT 许可证 分发。
包含的来源(实际说明)
此构建包含:
- CC0 基础数据库(见下文)
- 下述列出的 MIT 许可的增补内容(仅包含
source_effects.tsv中db_changes > 0的部分)
CC0 基础(已包含)
- 基础数据库:
genai-image-tag-db-cc0.sqlite - 源存储库: https://huggingface.co/datasets/NEXTAltair/genai-image-tag-db
影响此构建的 MIT 许可来源
(根据 source_effects.tsv 中 db_changes > 0 的记录得出)
TagDB_DataSource_CSV/A/danbooru.csv(MIT) — https://github.com/DominikDoom/a1111-sd-webui-tagcompleteTagDB_DataSource_CSV/A/derpibooru.csv(MIT) — https://github.com/DominikDoom/a1111-sd-webui-tagcompleteTagDB_DataSource_CSV/A/e621.csv(MIT) — https://github.com/DominikDoom/a1111-sd-webui-tagcompleteTagDB_DataSource_CSV/A/e621_sfw.csv(MIT) — https://github.com/DominikDoom/a1111-sd-webui-tagcompleteTagDB_DataSource_CSV/A/EnglishDictionary.csv(MIT) — https://github.com/DominikDoom/a1111-sd-webui-tagcompleteTagDB_DataSource_CSV/A/danbooru_machine_jp.csv(MIT) — https://github.com/boorutan/booru-japanese-tagTagDB_DataSource_CSV/A/rising_v2.csv(MIT) — 来源 URL 未知(整理/原始状态未知)TagDB_DataSource_CSV/A/dataset_rising_v2.csv(MIT) — 来源 URL 未知(整理/原始状态未知)TagDB_DataSource_CSV/rising_v3.csv(MIT) — https://huggingface.co/datasets/hearmeneigh/e621-rising-v3-preliminary-dataTagDB_DataSource_CSV/TagsList-Easter-e5.csv(MIT) — 来源 URL 未知(ZIP 文件中包含 MIT 许可证文件)TagDB_DataSource_CSV/TagsList-Easter-Final.csv(MIT) — 来源 URL 未知(ZIP 文件中包含 MIT 许可证文件)
数据清理说明
为确保 lang_ja、lang_zh、lang_ko 字段的清洁,构建过程移除了不包含预期文字的翻译:
ja: 必须包含平假名/片假名/中日韩统一表意文字 (CJK)zh: 必须包含中日韩统一表意文字 (CJK)ko: 必须包含韩文字母 (Hangul) 此为数据质量清理步骤(并非额外来源)。




