AniGamePersonaCaps
收藏资源简介:
AniGamePersonaCap是一个多模态数据集,收集了633,565个来自3,860个Fandom wiki站点的动漫、漫画和游戏角色。数据集包括图像和文本两种模态。图像模态包含角色的视觉图像,文本模态包含从HTML内容中提取的角色元信息和由视觉语言模型生成的描述。每个样本包含角色的图像、标题、站点名称、URL、描述、图像URL和字幕。字幕部分包括由人类编写和模型生成的外观和性格描述。数据集的收集过程涉及从Fandom wiki站点中提取角色页面,并进行数据清洗和处理。
AniGamePersonaCap is a multimodal dataset consisting of 633,565 anime, comic and game characters sourced from 3,860 Fandom wiki sites. The dataset includes two modalities: image and text. The image modality contains visual images of the characters, while the text modality encompasses character metadata extracted from HTML content and descriptions generated by vision-language models. Each sample comprises the character's image, title, site name, URL, description, image URL and caption. The caption section includes both human-written and model-generated descriptions of the characters' appearance and personality. The dataset collection process involves extracting character pages from Fandom wiki sites, followed by data cleaning and processing.
AniGamePersonaCap 数据集概述
数据集简介
AniGamePersonaCap 是一个多模态数据集,包含了 633,565 个来自 3,860 个 Fandom wiki 站点的动漫、漫画和游戏角色。数据集主要由以下两个模态组成:
-
图像模态
- 角色形象的视觉图像。
-
文本模态
- Fandom Wiki 元数据:从 HTML 内容中提取的角色元信息。
- 描述:
- VLM 生成的描述:由视觉语言模型(如 Qwen-VL-72B-Instruct)生成的角色外貌和性格描述。
- 人工编写的描述(部分):由人类编写的角色外貌和性格描述。
- 匿名化描述(部分):由 GPT-4o-mini 生成的匿名化描述。
数据结构
每个数据样本包含以下字段:
-
元数据:从
<meta>HTML 标签中提取的信息:title:角色名称site_name:Fandom wiki 站点名称url:角色页面的 URLdescription:角色的简要描述(可能被截断)image_url:角色图像的 URL(通常是页面上的第一个图像)
-
描述:从 HTML 解析或由 Qwen-VL 或 GPT-4o-mini 模型生成/改编:
appearance:human:人类编写的描述(仅 18% 的样本有非空值)anonymized:由 GPT-4o-mini 生成的匿名化描述(仅在存在human描述时非空)Qwen2-VL-7B-Instruct:由 Qwen2-VL-7B-Instruct 生成的描述Qwen2-VL-72B-Instruct-GPTQ-Int8:由 Qwen2-VL-72B-Instruct-GPTQ-Int8 生成的描述
personality:human:人类编写的描述(仅 19% 的样本有非空值)anonymized:由 GPT-4o-mini 生成的匿名化描述(仅在存在human描述时非空)Qwen2-VL-7B-Instruct:由 Qwen2-VL-7B-Instruct 生成的推理Qwen2-VL-72B-Instruct-GPTQ-Int8:由 Qwen2-VL-72B-Instruct-GPTQ-Int8 生成的推理
数据收集
数据集从超过 100 万个 Fandom 角色 wiki 页面中收集,这些页面可能与动漫、漫画或游戏相关。收集过程包括:
- 从游戏网站编译游戏实体列表,并使用 DuckDuckGo API 搜索其对应的 Fandom 站点。
- 参考 List of Anime and Manga Wikia 获取动漫和漫画的 Fandom 站点。
- 遍历每个 Fandom 站点的 "Category:Characters" 类别(包括嵌套类别),并检索所有成员页面。
数据处理
数据处理包括以下步骤:
- 去重 wiki 页面 URL 和图像 URL。
- 使用 Qwen2-VL-7B-Instruct 对非动漫/漫画/游戏风格的图像进行分类和过滤。
- 使用 BeautifulSoup 进行 HTML 解析,提取元信息和所需字段。
数据集应用
- 比较 7B 和 72B 模型的性能
- 分析 Qwen VLMs 在 AniGamePersonaCap 上的幻觉问题
- 使用 AniGamePersonaCap 蒸馏 Qwen2-VL-72B-Instruct
- 使用 VLM 描述和角色图像微调文本到图像模型
- 分析视觉线索与性格之间的关系




