遇见数据集

Gelbooru-Tags-Full_2026-06-11

收藏
Hugging Face2026-06-13 更新2026-06-14 收录
官方服务:

资源简介:

本数据集包含于2026年6月11日从Gelbooru图像分享网站的API获取的完整标签列表,旨在为下游任务(如标签处理、内容分析)提供全面的标签元数据。数据集提供两个格式版本(Parquet和JSONL),内容相同,核心字段包括标签ID、标签名称、关联的帖子数量、类别ID(0至6,分别对应通用、艺术家、无效/未使用、版权、角色、元数据和废弃类别)以及标签是否模糊的标识。数据规模覆盖Gelbooru平台上的所有标签,使用者可能需要进行筛选(例如从类别6的废弃标签开始)。一个显著特点是包含一个应用于绝大多数帖子(仅约160万帖子未使用)的空标签,该标签的帖子数量最高。Parquet文件按标签ID升序排序,推荐用于数据处理;JSONL文件则按帖子数量排序,字段名更接近原始API响应,便于人工查看和兼容性处理。

This dataset contains a complete list of tags obtained from the Gelbooru image sharing websites API on June 11, 2026, aiming to provide comprehensive tag metadata for downstream tasks such as tag processing and content analysis. The dataset includes two format versions (Parquet and JSONL) with identical content, core fields including tag ID, tag name, associated post count, category ID (0 to 6, corresponding to general, artist, invalid/unused, copyright, character, metadata, and deprecated categories), and a flag indicating whether the tag is ambiguous. The data scale covers all tags on the Gelbooru platform, and users may need to perform filtering (e.g., starting from category 6 deprecated tags). A notable feature is the inclusion of an empty tag applied to the vast majority of posts (only about 1.6 million posts not using it), which has the highest post count. The Parquet file is sorted in ascending order by tag ID, recommended for data processing; the JSONL file is sorted by post count, with field names closer to the original API response for easier manual viewing and compatibility handling.

创建时间:
2026-06-11
原始信息汇总

数据集概述

该数据集从 Gelbooru 的 API 获取,收集于 2026年6月11日。数据集包含 Gelbooru 上所有标签的信息,适用于需要完整标签列表的下游任务,但用户可能需要自行进行数据清洗(例如移除类别6的废弃标签)。

数据内容

每条记录包含以下字段:

  • Tag ID:标签的唯一标识符。
  • Tag Name:标签名称。
  • Post Count:使用该标签的帖子数量。
  • Category ID:标签类别ID(取值范围0至6),类别名称对照表如下:
ID 类别名称
0 General
1 Artist
2 Invalid / Unused
3 Copyright
4 Character
5 Meta
6 Deprecated
  • Is Ambiguous:标签是否具有歧义(布尔值)。

文件格式

数据集提供两种格式,数据内容相同:

  • Parquet 文件(推荐使用):按标签ID升序排列,可通过 Hugging Face 数据集查看器按不同列排序。
  • JSONL 文件:按帖子计数降序排列,更接近 Gelbooru API 原始响应格式(使用换行分隔而非数组)。

两种格式的字段名差异:

JSONL 字段名 Parquet 字段名
id tag_id
name tag_name
count post_count
type category_id
ambiguous is_ambiguous

注意事项

  • 数据集中存在一个空标签/空字符串,几乎应用于所有帖子(仅约160万帖子未包含该标签),因此拥有最高的帖子计数。
  • 标签收集耗时约4-5小时,API响应频率在完成50%页面后显著下降。
  • 数据获取代码可在 GitHub 查看。

许可协议

数据集采用 Apache 2.0 许可证。

搜集汇总
数据集介绍
Gelbooru-Tags-Full_2026-06-11 数据集图片
构建方式
该数据集源自知名动漫图片分享平台Gelbooru,通过调用其API接口,于2026年6月11日采集了全部标签信息。数据获取过程历经约4至5小时,遍历了所有页面(最大页面ID约13935,每页限制100条),最终整理为Parquet与JSONL两种格式文件。Parquet文件按标签ID升序排列,JSONL文件则依据标签关联的图片数量排序,两者核心数据一致,仅在键名和排序方式上存在细微差异,以适应不同使用场景。
特点
数据集囊括了Gelbooru所有标签的详尽信息,每条记录包含标签ID、名称、关联图片数量、类别ID(覆盖0至6共七类,如通用、艺术家、版权、角色、元数据、废弃等)以及是否歧义标记。特别值得注意的是,存在一个几乎应用于所有图片的空白标签,其图片数量最高,此外废弃类别(类别6)的标签需在应用前进行清理。Parquet格式因高效压缩和结构化查询能力更适宜下游任务,而JSONL格式则保留了更接近API原始响应的结构。
使用方法
用户可通过HuggingFace Datasets库直接加载Parquet文件进行高效处理,利用标签ID或类别ID进行筛选,例如剔除废弃标签以优化数据质量。若需与Gelbooru API返回格式兼容,可选用JSONL版本。建议优先考虑Parquet格式,并利用数据集的标签类别和关联图片数量对标签进行重要性排序或降噪,以服务于图像标注、多标签分类模型训练或标签推荐系统等下游任务。
背景与挑战
背景概述
Gelbooru-Tags-Full_2026-06-11 数据集由匿名开发者于2026年6月11日创建,旨在系统性地收集 Gelbooru 平台上的全部标签数据。Gelbooru 是一个大型动漫图像共享网站,其标签系统涵盖了通用、艺术家、版权、角色、元数据及废弃标签等多种类别,是计算机视觉与多模态研究中不可或缺的标注资源。该数据集通过平台API获取,包含标签ID、名称、帖子计数、类别ID及歧义标记等关键字段,为下游任务如标签推荐、内容分类及图像理解提供了全面基础。作为完整的标签清单,它显著降低了研究者自行爬取和清洗的数据门槛,对推动动漫领域的数据驱动研究具有奠基性影响。
当前挑战
该数据集所面临的挑战首先源于Gelbooru标签系统的固有复杂性。尽管数据集囊括了全部标签,但最大帖子数标签竟是一个空字符串,且广泛附着于几乎所有帖子,这揭示了标签分布中存在的严重噪声与偏差,研究者必须进行有效剪枝以释放其真正价值。此外,构建过程中遭遇了API性能瓶颈——当请求超过50%的页面后,响应速度显著放缓,整体采集耗时约4-5小时,且无法直接按帖子数排序,不得不采用全量抓取策略完成数据收集。这些技术限制不仅提高了数据获取的时间成本,也凸显了依赖外部API构建大规模结构化数据时面临的效率和完整性难题。
常用场景
经典使用场景
Gelbooru-Tags-Full_2026-06-11数据集汇聚了从Gelbooru平台采集的完整标签体系,涵盖标签ID、名称、帖子计数、类别标识及歧义性标记等核心字段。在计算机视觉与自然语言处理的交叉领域中,该数据集常被用于构建多标签图像分类模型,尤其是面向动漫风格的细粒度内容理解。研究者可借助其丰富的类别划分(如角色、艺术家、版权、通用标签等)训练能够精准识别图像中多元语义要素的算法,从而推动视觉语义空间的结构化建模。
解决学术问题
该数据集有效解决了动漫图像领域标签稀疏性与类别不均衡的学术难题。通过提供包含百亿级帖子标签关联的完整统计信息,研究者可系统分析标签分布规律,进而开发针对长尾标签的鲁棒学习策略。同时,其提供的歧义性标记字段为消除语义噪声、提升标签消歧算法的可靠性提供了关键基准,显著促进了面向非结构化视觉内容的层次化分类与元学习范式的发展。
衍生相关工作
该数据集衍生了多项值得关注的经典工作。例如,研究者利用其标签分类表构建了去偏见的视觉语言预训练模型,通过屏蔽废弃标签(类别6)增强了训练数据的纯度。另有工作基于帖子计数字段设计了标签重要性采样策略,显著提升了低资源场景下的少样本学习性能。此外,该数据集的API兼容性启发了一系列标签质量管理工具,推动社区形成了基于统计更新的标签纠错与补全标准流程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务