AnimeOmni
收藏资源简介:
AnimeOmni是一个用于视觉-语言模型训练和基于扩散的文本到图像生成的丰富注释动漫角色数据集。它包含9,516个安全评级的动漫角色图像,每个图像配有多层结构化注释:一个详细的自然语言描述(caption)、一个两级分类体系(family→category)、一个角色表情标签(expression)以及原始描述性标签(tags)。此外,每条记录还预格式化为人类/助手的对话形式,可直接用于视觉-语言模型的微调流程。数据集支持多种任务:视觉-语言模型(VLM)的微调与评估、扩散模型的文本到图像生成、基于分类的过滤与平衡、以及图像检索等。每个样本的字段包括:pid(源标识符)、file_name、caption、family、category、expression、tags、t2i_tags(用于T2I的逗号分隔标签)、图像尺寸、宽高比、rating、source和vlm_conversation(对话格式)。分类体系涵盖多个家族,如Kemonomimi、Fantasy & Sci-Fi、Horror & Dark、Maid & Service、Gender Archetypes、Outfits & Subcultures等,每个家族下有具体类别。表情标签如serene、tsundere、cheerful等。数据经过严格的质量控制,包括分辨率检测、空白检测、重复检测、标签充足性检查、描述验证等。该数据集基于CC BY 4.0许可发布,注释和编译工作受保护,但底层图像来自第三方艺术家,需自行验证适用性。
AnimeOmni is a richly annotated anime character dataset for vision-language model training and diffusion-based text-to-image generation. It contains 9,516 safely rated anime character images, each with multi-layered structured annotations: a detailed natural language caption, a two-level classification hierarchy (family→category), an expression label, and raw descriptive tags. Additionally, each record is pre-formatted as human/assistant conversations, directly usable for fine-tuning vision-language models. The dataset supports multiple tasks: fine-tuning and evaluation of VLMs, text-to-image generation with diffusion models, classification-based filtering and balancing, and image retrieval. Each sample includes fields: pid (source identifier), file_name, caption, family, category, expression, tags, t2i_tags (comma-separated tags for T2I), image dimensions, aspect ratio, rating, source, and vlm_conversation (dialogue format). The classification covers families such as Kemonomimi, Fantasy & Sci-Fi, Horror & Dark, Maid & Service, Gender Archetypes, Outfits & Subcultures, etc., with specific categories under each. Expression labels include serene, tsundere, cheerful, etc. Data underwent rigorous quality control including resolution detection, blank detection, duplicate detection, tag sufficiency checks, and caption validation. The dataset is released under CC BY 4.0 license, with annotations and compilation protected, but underlying images from third-party artists require independent verification of suitability.
🌸 AnimeOmni 数据集概述
AnimeOmni 是一个用于视觉语言模型(VLM)训练和基于扩散模型的文生图(T2I)生成的动漫角色数据集,包含 11,519 个标注样本,所有样本均通过安全评级(safe)。数据集采用 CC BY 4.0 许可,最后更新于 2026-08-06。
核心特点
- 多层标注结构:每个样本包含自然语言描述(
caption)、两级原型分类(family→category)、表情标签(expression)以及原始描述性标签(tags)。 - 双格式文本字段:同时提供密集的
caption(用于 VLM)和紧凑的t2i_tags(逗号分隔,用于扩散模型条件生成),无需额外预处理即可适配不同训练场景。 - 预格式化对话:每个记录包含
vlm_conversation字段,以human/gpt对话形式呈现,可直接用于 VLM 微调。 - 三轴独立分类:每个样本沿“角色类型”、“穿着/身份原型”和“表情”三个独立维度分类,便于按需过滤、平衡或条件生成。
数据规模与结构
- 样本数量:11,519 条标注样本。
- 发布方式:按增量批次发布,每个顶层文件夹代表一个连续的 ID 范围(例如
000001-000500),内部包含metadata.jsonl和data/图像文件夹。 - 数据格式:
metadata.jsonl每行一个 JSON 记录,字段包括pid、file_name、caption、family、category、expression、tags、t2i_tags、width、height、aspect_ratio、rating、source和vlm_conversation。
原型分类(Archetype Taxonomy)
family 和 category 构成两级分类体系,覆盖以下主要类别(示例):
| Family | 示例类别 |
|---|---|
| Kemonomimi | kitsune, neko, usagi, ookami, inu, nezumi, hyena, umamusume, tora, hitsuji, kuma |
| Fantasy & Sci-Fi | dragon_girl, elf, mecha_girl, magical_girl |
| Horror & Dark | vampire, succubus |
| Maid & Service | classic_maid, cat_maid, gothic_maid, nurse |
| Gender Archetypes | bishounen, tomboy, femboy_trap |
| Outfits & Subcultures | school_uniform, gothic_lolita, kimono_yukata, swimsuit, bunny_suit, casual_hoodie |
| Everyday & School | 上下文相关,由标签推导 |
| Action & Combat | 上下文相关,由标签推导 |
| Sci-Fi & Cyberpunk | 上下文相关,由标签推导 |
expression 是自由格式但一致的 snake_case 标签,常见值包括 embarrassed_blushing、tsundere、smug、cheerful、pouting、serene、neutral、angry_scowling、crying_sadly、surprised_shocked、sleepy、yandere、winking、mischievous 和 scared 等。
标注过程与质量控制
- 标注生成:由 AI 视觉语言模型基于图像和描述性标签生成标题、原型标签和表情标签,并对明确的原型类别应用确定性标签到类别的覆盖规则,以保证一致性。
- 质量控制措施:
- 分辨率和构图检查(强制最小尺寸和宽高比范围)
- 空白或占位图像检测(拒绝低对比度、接近空或退化图像)
- 重复检测(通过加密哈希捕捉精确重复,通过感知哈希捕捉近似重复,并维护持久索引)
- 标签充足性检查(标签过少的样本被跳过)
- 标题验证(过短、空或非回答型标题被丢弃并重试或删除)
- 超大源图像拒绝(防止解压炸弹式输入)
- 发布后完整性检查(每个批次在上传后和后续运行中自动验证,图像数量与元数据不匹配的批次自动移除)
预期用途
- 视觉语言 / 多模态模型:使用
vlm_conversation直接微调或评估 VLM;基于caption进行图像到文本和视觉问答研究。 - 扩散 / 文生图生成:使用
t2i_tags或caption作为条件,微调或 LoRA 训练扩散模型;利用family/category/expression进行标签到图像或原型条件生成;构建风格平衡的训练子集。 - 分类与检索:原型和表情分类研究;基于
family、category或expression过滤构建平衡子集;使用标签/标题对进行文生图和图生图检索基准测试。
局限性与偏差
- 标题和分类标签由 AI 生成,尽管有标签基础和验证,仍可能偶尔出现不准确或样本间粒度不一致的情况。
- 原型分类体系是固定且精选的,可能无法捕捉角色的所有视觉细节。
- 源图像来自单一图像板式平台,可能无法代表动漫艺术的全部风格多样性。
许可与归属
- 数据集的编译结构及其创建的标注层(标题、分类、表情标签和元数据)以 CC BY 4.0 许可发布,归属应引用此数据集和仓库。
- 底层图像来自第三方艺术家,许可仅涵盖标注和编译工作,不涵盖原始艺术品的既有权利。分发前请自行验证适用性。





