遇见数据集
官方服务:

资源简介:

AnimeOmni是一个用于视觉-语言模型训练和基于扩散的文本到图像生成的丰富注释动漫角色数据集。它包含9,516个安全评级的动漫角色图像,每个图像配有多层结构化注释:一个详细的自然语言描述(caption)、一个两级分类体系(family→category)、一个角色表情标签(expression)以及原始描述性标签(tags)。此外,每条记录还预格式化为人类/助手的对话形式,可直接用于视觉-语言模型的微调流程。数据集支持多种任务:视觉-语言模型(VLM)的微调与评估、扩散模型的文本到图像生成、基于分类的过滤与平衡、以及图像检索等。每个样本的字段包括:pid(源标识符)、file_name、caption、family、category、expression、tags、t2i_tags(用于T2I的逗号分隔标签)、图像尺寸、宽高比、rating、source和vlm_conversation(对话格式)。分类体系涵盖多个家族,如Kemonomimi、Fantasy & Sci-Fi、Horror & Dark、Maid & Service、Gender Archetypes、Outfits & Subcultures等,每个家族下有具体类别。表情标签如serene、tsundere、cheerful等。数据经过严格的质量控制,包括分辨率检测、空白检测、重复检测、标签充足性检查、描述验证等。该数据集基于CC BY 4.0许可发布,注释和编译工作受保护,但底层图像来自第三方艺术家,需自行验证适用性。

AnimeOmni is a richly annotated anime character dataset for vision-language model training and diffusion-based text-to-image generation. It contains 9,516 safely rated anime character images, each with multi-layered structured annotations: a detailed natural language caption, a two-level classification hierarchy (family→category), an expression label, and raw descriptive tags. Additionally, each record is pre-formatted as human/assistant conversations, directly usable for fine-tuning vision-language models. The dataset supports multiple tasks: fine-tuning and evaluation of VLMs, text-to-image generation with diffusion models, classification-based filtering and balancing, and image retrieval. Each sample includes fields: pid (source identifier), file_name, caption, family, category, expression, tags, t2i_tags (comma-separated tags for T2I), image dimensions, aspect ratio, rating, source, and vlm_conversation (dialogue format). The classification covers families such as Kemonomimi, Fantasy & Sci-Fi, Horror & Dark, Maid & Service, Gender Archetypes, Outfits & Subcultures, etc., with specific categories under each. Expression labels include serene, tsundere, cheerful, etc. Data underwent rigorous quality control including resolution detection, blank detection, duplicate detection, tag sufficiency checks, and caption validation. The dataset is released under CC BY 4.0 license, with annotations and compilation protected, but underlying images from third-party artists require independent verification of suitability.

创建时间:
2026-08-06
原始信息汇总

🌸 AnimeOmni 数据集概述

AnimeOmni 是一个用于视觉语言模型(VLM)训练和基于扩散模型的文生图(T2I)生成的动漫角色数据集,包含 11,519 个标注样本,所有样本均通过安全评级(safe)。数据集采用 CC BY 4.0 许可,最后更新于 2026-08-06。


核心特点

  • 多层标注结构:每个样本包含自然语言描述(caption)、两级原型分类(familycategory)、表情标签(expression)以及原始描述性标签(tags)。
  • 双格式文本字段:同时提供密集的 caption(用于 VLM)和紧凑的 t2i_tags(逗号分隔,用于扩散模型条件生成),无需额外预处理即可适配不同训练场景。
  • 预格式化对话:每个记录包含 vlm_conversation 字段,以 human/gpt 对话形式呈现,可直接用于 VLM 微调。
  • 三轴独立分类:每个样本沿“角色类型”、“穿着/身份原型”和“表情”三个独立维度分类,便于按需过滤、平衡或条件生成。

数据规模与结构

  • 样本数量:11,519 条标注样本。
  • 发布方式:按增量批次发布,每个顶层文件夹代表一个连续的 ID 范围(例如 000001-000500),内部包含 metadata.jsonldata/ 图像文件夹。
  • 数据格式metadata.jsonl 每行一个 JSON 记录,字段包括 pidfile_namecaptionfamilycategoryexpressiontagst2i_tagswidthheightaspect_ratioratingsourcevlm_conversation

原型分类(Archetype Taxonomy)

familycategory 构成两级分类体系,覆盖以下主要类别(示例):

Family 示例类别
Kemonomimi kitsune, neko, usagi, ookami, inu, nezumi, hyena, umamusume, tora, hitsuji, kuma
Fantasy & Sci-Fi dragon_girl, elf, mecha_girl, magical_girl
Horror & Dark vampire, succubus
Maid & Service classic_maid, cat_maid, gothic_maid, nurse
Gender Archetypes bishounen, tomboy, femboy_trap
Outfits & Subcultures school_uniform, gothic_lolita, kimono_yukata, swimsuit, bunny_suit, casual_hoodie
Everyday & School 上下文相关,由标签推导
Action & Combat 上下文相关,由标签推导
Sci-Fi & Cyberpunk 上下文相关,由标签推导

expression 是自由格式但一致的 snake_case 标签,常见值包括 embarrassed_blushingtsunderesmugcheerfulpoutingsereneneutralangry_scowlingcrying_sadlysurprised_shockedsleepyyanderewinkingmischievousscared 等。


标注过程与质量控制

  • 标注生成:由 AI 视觉语言模型基于图像和描述性标签生成标题、原型标签和表情标签,并对明确的原型类别应用确定性标签到类别的覆盖规则,以保证一致性。
  • 质量控制措施
    • 分辨率和构图检查(强制最小尺寸和宽高比范围)
    • 空白或占位图像检测(拒绝低对比度、接近空或退化图像)
    • 重复检测(通过加密哈希捕捉精确重复,通过感知哈希捕捉近似重复,并维护持久索引)
    • 标签充足性检查(标签过少的样本被跳过)
    • 标题验证(过短、空或非回答型标题被丢弃并重试或删除)
    • 超大源图像拒绝(防止解压炸弹式输入)
    • 发布后完整性检查(每个批次在上传后和后续运行中自动验证,图像数量与元数据不匹配的批次自动移除)

预期用途

  • 视觉语言 / 多模态模型:使用 vlm_conversation 直接微调或评估 VLM;基于 caption 进行图像到文本和视觉问答研究。
  • 扩散 / 文生图生成:使用 t2i_tagscaption 作为条件,微调或 LoRA 训练扩散模型;利用 family/category/expression 进行标签到图像或原型条件生成;构建风格平衡的训练子集。
  • 分类与检索:原型和表情分类研究;基于 familycategoryexpression 过滤构建平衡子集;使用标签/标题对进行文生图和图生图检索基准测试。

局限性与偏差

  • 标题和分类标签由 AI 生成,尽管有标签基础和验证,仍可能偶尔出现不准确或样本间粒度不一致的情况。
  • 原型分类体系是固定且精选的,可能无法捕捉角色的所有视觉细节。
  • 源图像来自单一图像板式平台,可能无法代表动漫艺术的全部风格多样性。

许可与归属

  • 数据集的编译结构及其创建的标注层(标题、分类、表情标签和元数据)以 CC BY 4.0 许可发布,归属应引用此数据集和仓库。
  • 底层图像来自第三方艺术家,许可仅涵盖标注和编译工作,不涵盖原始艺术品的既有权利。分发前请自行验证适用性。
搜集汇总
数据集介绍
AnimeOmni 数据集图片
构建方式
AnimeOmni数据集构建了一套精细的注释体系,将动漫角色图像与多维结构化标签相结合。每个样本均包含自然语言描述、双层原型分类(家族至子类)、角色表情标注及原始描述标签,并预先生成对话格式,便于直接用于视觉语言模型微调。注释过程借助AI视觉语言模型,结合图像标签进行锚定,辅以确定性标签到类别的映射规则,确保关键原型的标注一致性。所有图像与标注都经过自动化质量检验,包括分辨率检查、空白检测、重复数据剔除、标签充分性验证和描述有效性审查,以及发布后的完整性校验。
特点
AnimeOmni的核心特色在于其三维独立的标注轴——角色类型、服装/身份原型和情感表达,使用户能够依据任一维度灵活筛选、平衡或条件化数据,无需重新注释。数据集同时提供密集自然语言的caption和简洁逗号分隔的t2i_tags字段,满足视觉语言模型与扩散模型两种截然不同的训练需求。此外,双层原型分类体系(如Kemonomimi、Fantasy & Sci-Fi、Maid & Service等)与细粒度的表情标签(如embarrassed_blushing、tsundere等)共同构建了丰富的语义层次,为多样化的下游任务提供了坚实的数据基础。
使用方法
AnimeOmni的即用性体现在其多层次的适用场景。对于视觉语言模型,可直接使用预构建的vlm_conversation进行对话式微调,或依托caption开展图像描述与视觉问答研究。对于扩散模型,t2i_tags字段提供了紧凑的提示词式条件,而caption则可作为密集型描述控制,支持标签到图像、原型条件生成及LoRA微调。数据集的分类标签还支持构建均衡的训练子集,应用于原型分类、表情识别及图文检索等任务,其灵活的数据结构使其成为多模态研究的理想资源。
背景与挑战
背景概述
AnimeOmni数据集由一群致力于推动动漫领域多模态人工智能发展的研究者于2026年创建,旨在填补动漫角色图像与结构化语义标注之间的鸿沟。该数据集包含12,020个安全评级的样本,每个样本均配有多层次的注释,包括自然语言描述、角色原型分类(族系至类别)、表情标签及原始标签,适用于视觉语言模型训练和扩散模型文本到图像生成。数据集的构建以角色类型、服饰/身份和情感三个独立轴为分类标准,支持灵活的过滤与条件生成。AnimeOmni的发布为动漫图像理解与生成研究提供了宝贵的资源,尤其在角色描述、原型分类和情感识别方面设立了新的基准,对VLM微调和T2I模型训练均有显著推动作用。
当前挑战
AnimeOmni数据集面临多重挑战。在领域层面,动漫图像的多样性、风格差异和角色形态的复杂性使得自动标注准确性和一致性成为难题,例如区分不同兽耳类别或识别复杂情感表达。构建过程中,团队需要处理标注噪声、低质量图像筛选、近重复检测以及版权合规问题。具体而言,AI生成的标注模型可能出错,需通过确定性标签映射和校验缓解;图像来源单一可能限制风格多样性,而版权声明仅覆盖注释层,用户还需自行核实原图权利。此外,数据集的分类体系为动态模式,需持续维护以避免概念漂移,且批量发布增加了质量控制难度,任何批次图像计数不匹配都会触发自动移除,确保数据完整性。
常用场景
经典使用场景
AnimeOmni数据集在视觉语言模型(VLM)与扩散模型(Diffusion)的交叉领域开创了新的研究范式。其核心设计融合了结构化的多维度标注(原型分类、表情识别、标签条件)与自然语言描述,使得研究者能够在统一的框架下探索从细粒度特征到高层语义的映射机制。该数据集特别适合用于评估和微调多模态模型在动漫风格图像理解与生成的性能,涵盖图像描述、视觉问答、文本到图像生成等经典任务,为模型提供高质量的中等规模数据支撑,是连接图像语义与文字表达的理想桥梁。
解决学术问题
该数据集有效解决了动漫图像领域中标注稀疏与语义粒度不匹配等关键学术难题。通过引入双层原型分类体系(family-category)和细粒度表情标注,AnimeOmni使得研究者能够量化分析模型的语义理解能力,避免了传统单一标签数据集的歧义性。其动态生成的VLM对话格式,大幅降低了多模态研究的数据预处理门槛,促进了对视觉-语言对齐机制的深入探究。同时,数据集对安全性和质量控制的严格要求,为构建高可靠性学术基准提供了坚实基础,推动了合成数据验证与模型泛化能力评估方法的发展。
衍生相关工作
AnimeOmni的出现催化了一系列创新性的后续研究。一方面,其原型分类标签体系被后续工作采用,推动了面向动漫角色的复杂属性识别模型(如属性级检索)的发展,衍生了针对稀疏标签场景的对比学习与自监督方法。另一方面,该数据集提供的双模态条件(标签与描述)为文本到图像生成模型的条件解耦研究提供了数据基础,催生了多条件控制生成、风格迁移等细分方向的探索。其制备流程中强调的质量审计与覆盖均衡策略,也启发了高噪声环境下的数据集构建理论,为其他领域的数据治理研究提供了参照范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务