遇见数据集

Danbooru Implication Map

收藏
github2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

Danbooru的完整标签蕴含图(在119,800个标签名称上有45,501个活跃蕴含关系)作为一个本地SQLite数据集,外加一个自包含的离线HTML探索器。

The complete tag implication graph of Danbooru, which has 45,501 active implication relations across 119,800 tag names, is provided as a local SQLite dataset, along with a self-contained offline HTML explorer.

创建时间:
2026-08-26
原始信息汇总

数据集概述

Danbooru Implication Map 是一个将 Danbooru 网站的完整标签蕴含图(tag implication graph)打包为单个离线 HTML 文件的可视化探索工具。该数据集快照日期为 2026-08-22,包含约 12 万个标签及其蕴含关系。


核心数据统计

指标 数值
标签名称总数 119,800
图中出现的标签数 53,026
蕴含关系总行数 55,664 行(活跃 45,501)
别名关系总行数 64,572 行(活跃 40,732)
根家族数 9,505
连通组数 8,698
全图深度 5
数据集快照时间 2026-08-22

数据结构

数据集以 SQLite 数据库(约 30 MB)形式存储,包含以下核心表:

  • implications — 完整标签蕴含关系(含已删除记录)
  • aliases — 标签别名映射
  • tags_all — 标签名称、帖子计数、类别、弃用状态
  • wiki — 按需缓存的词条内容
  • overrides — 手动修正覆盖层(不修改同步数据)
  • sync_state — 同步水位线、时间戳、API 调用计数

功能特性

五种可视化视图

  1. Landscape — 对数-对数散点图,每个家族一个点,展示数据集整体形态
  2. Atlas — 可缩放树状图,展示大型家族(50+ 后代)的层级结构
  3. Focus — 局部分层有向无环图,展示单个标签周围的蕴含关系
  4. Tree — 可折叠的完整传递闭包大纲,支持方向切换和分支计数
  5. Paths — 两个标签之间的最短蕴含链,无直接路径时回退到共同蕴含的最近标签

核心交互

  • 全局搜索覆盖全部 119,800 个名称,含近似匹配(如 weponweapon
  • 统一过滤器,可同时应用于所有视图(类别、最低帖子数、弃用状态)
  • 收藏篮(Basket)支持跨视图固定标签,可导出为名称、CSV、JSON 等格式
  • 所有页面状态通过 URL hash 深链接,浏览器前进/后退可用
  • 完整键盘操作支持(搜索、视图切换、固定、追踪等快捷键)

无障碍与响应式

  • 所有控件为真实可聚焦元素,带可见焦点环
  • 触屏设备支持拖拽、平移和捏合缩放
  • 窄屏(<1000px)自动切换为抽屉式布局

技术实现

  • 数据获取:通过 keyset 分页从 Danbooru 公共 API 拉取完整蕴含和别名表,首次冷启动约 15 分钟、~1,750 次 API 调用,后续增量同步
  • 运行环境:查看器零依赖,仅需浏览器;重建或重新同步需要 Python 3.11+(仅标准库)
  • 存储形式:构建产物为单个自包含 HTML 文件(约 4.8 MiB),可离线双击运行
  • 可选发布:支持一键部署到 Cloudflare Workers(免费套餐)

数据说明

  • 完整性:因直接拉取完整数据表,对任意标签 X 均能展示同步时刻站点上所有活跃蕴含关系
  • 弃用标签:691 个标签被标记为弃用,但都出现在已删除的蕴含行中,因此图中活跃蕴含数不包含弃用标签
  • 同步注意:同步时不应伪装浏览器 User-Agent,否则可能被 CDN 拒绝

许可与来源

标签数据为 Danbooru 所有,通过其公共 API 获取,使用时需遵守 Danbooru 条款。查看器和工具代码为纯 JavaScript 和 Python 实现,无第三方依赖,未从 CDN 捆绑任何资源。

搜集汇总
数据集介绍
Danbooru Implication Map 数据集图片
构建方式
Danbooru Implication Map数据集基于Danbooru社区标签体系的完整蕴含图构建而成。项目通过键集分页技术,从Danbooru公开API抓取全部tag_implications与tag_aliases数据表,汇总至本地SQLite数据库,再经特定工具编译为单一自包含的交互式探索器HTML文件。该文件无需服务器或网络,双击即可运行,实现了数据集的静态化封装。数据集快照日期为2026-08-22,涵盖近12万标签名称、5.5万余条蕴含关系及6.4万余个别名记录,并包含人工标注的覆写层,确保数据准确性与可维护性。
特点
该数据集的核心特征在于其全网视角的完整性与深度。它囊括Danbooru全部标签蕴含关系,而非局部邻域,使得任意标签的完整语义路径可追溯,图深度最大为5。数据可视化提供五种协同视图——景观图展示家族规模分布对数图、地图集呈现缩放树图、焦点图揭示局部DAG结构、树状图列出全传递闭包、路径图计算两标签间最短蕴含链。所有视图联动于单一选择,支持深度链接、键盘导航及辅助技术适配,并内置篮筐机制便于批量导出,确保了数据探索的灵活性与无障碍性。
使用方法
用户可通过多种方式使用该数据集。直接双击danbooru_explorer.html文件即可在浏览器离线浏览,或运行start.bat脚本自动构建并打开。支持命令行参数实现重建、同步最新数据、本地服务模式等高级操作。对于开发需求,implications_tool.py提供了同步、构建、管理覆写等功能的纯标准库CLI接口。数据集还支持直接SQL查询SQLite数据库,便于程序化分析。探索器状态可通过URL哈希分享,兼容历史记录,并提供Cloudflare一键部署方案,使数据集的访问与分发极为便捷。
背景与挑战
背景概述
Danbooru Implication Map数据集由独立开发者于2026年构建,旨在全面呈现Danbooru平台约12万标签间的蕴含关系网络。该数据集整合了完整的tag_implications与tag_aliases表格,形成包含5.5万余条蕴含关系及6.4万余个别名的结构化图谱,并配套提供自包含的交互式可视化工具。其核心研究问题在于探索大规模众包标签体系中蕴含关系的层级结构与语义组织模式,为标签推荐、内容检索及知识图谱构建等领域提供数据支撑。该数据集以单文件HTML形式发布,无需服务器或网络依赖,极大降低了使用门槛,对数字内容管理及语义网络研究具有重要参考价值。
当前挑战
该数据集面临多维度挑战。在领域问题层面,标签蕴含关系本身具有DAG结构复杂性,深度可达5层,且存在多根节点交织形成的连通组群,如何高效可视化并导航如此庞大的语义网络是一大难题;同时,标签别名与蕴含关系的动态演变(如废弃标签的隐含关系自动删除)要求数据同步机制具备高度可靠性。在构建过程中,冷启动需通过约1750次API调用耗时15分钟拉取全量数据,期间需处理CDN对非浏览器User-Agent的拦截及UA/TLS不匹配问题;数据一致性维护亦具挑战,如水位线以下的编辑与删除难以及时捕获,需定期全量刷新以校正状态,而手动覆盖机制的引入则需谨慎平衡自动化与人工修正的冲突。
常用场景
经典使用场景
Danbooru Implication Map数据集的核心应用场景在于构建并可视化大规模标签蕴涵图。作为该领域的经典范例,它巧妙整合了Danbooru社区近12万个标签及其间的蕴涵与别名关系,生成的交互式探索器支持五种视图(景观、图谱、聚焦、树状、路径),使用户得以从宏观格局至微观关联多维度审视标签体系。此工具不仅为研究标签语义结构提供了直观平台,也广泛用于内容分类、信息检索及社交网络分析的教学与演示。
实际应用
在实际应用中,Danbooru Implication Map被广泛用于内容管理系统的标签推荐与自动标注,显著提升了图像检索和内容发现的效率。电商平台借助其蕴涵关系优化商品分类,社交媒体利用别名解析增强搜索体验。此外,可离线运行的特性使其成为教育工具,帮助学生理解复杂层级结构;在数字人文领域,它也被用于分析社区分类文化的演变。其静态文件部署方式更便于跨平台集成与二次开发。
衍生相关工作
该数据集衍生了多项开创性工作,如基于蕴涵图的标签预测任务,利用图神经网络推断缺失关联;在视觉-语言模型领域,其蕴含关系被用于增强图像描述的语义一致性。此外,研究者开发了标签传播算法,优化多标签分类的精度。可视化层面,催生了多种适应大规模图的交互工具,例如簇状树图与径向布局的革新。这些工作拓展了标签图数据的应用边界,为图数据挖掘与可视化研究提供了新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务